AI 部署與最佳化
請依模型與推論執行環境選擇文件。以下是兩種部署選擇,使用 llama.cpp 前不需要先完成 TensorRT 教學。
選擇部署方式
| 你的目標 | 文件 | 重點 |
|---|---|---|
| 將 ONNX 模型轉換為 NVIDIA 平台的推論引擎 | TensorRT 模型轉換 | 驅動與執行環境準備、引擎轉換,以及透過 trtexec 執行推論。 |
| 在邊緣裝置上執行 LLM | LLM 邊緣部署 | 編譯 llama.cpp、準備 GGUF 模型、建立效能基準,以及推論效能調校。 |
開始之前
先確認所選文件列出的目標平台與軟體版本。TensorRT 的適用範圍不限於 VLM 或 LLM;LLM 文件則使用獨立的 llama.cpp 工作流程。
若要實作 ASR-D501 搭配 Qualcomm AI Hub 的相機推論示範,請前往自主系統。