跳至主要内容

AI 部署與最佳化

請依模型與推論執行環境選擇文件。以下是兩種部署選擇,使用 llama.cpp 前不需要先完成 TensorRT 教學。

選擇部署方式​

你的目標文件重點
將 ONNX 模型轉換為 NVIDIA 平台的推論引擎TensorRT 模型轉換驅動與執行環境準備、引擎轉換,以及透過 trtexec 執行推論。
在邊緣裝置上執行 LLMLLM 邊緣部署編譯 llama.cpp、準備 GGUF 模型、建立效能基準,以及推論效能調校。

開始之前​

先確認所選文件列出的目標平台與軟體版本。TensorRT 的適用範圍不限於 VLM 或 LLM;LLM 文件則使用獨立的 llama.cpp 工作流程。

若要實作 ASR-D501 搭配 Qualcomm AI Hub 的相機推論示範,請前往自主系統。


← 解決方案總覽