策略選擇:ACT 與 GR00T N1.5
訓練頁的「策略選擇」為一下拉選單,提供 ACT 與 GR00T N1.5 兩個選項,介面提示為「選擇要使用的訓練策略演算法,不同策略適合不同類型的任務」。
此一選擇的影響範圍超出訓練階段本身,同時決定了三項後續條件:所需的示範次數、訓練的步數量級,以及最終可用的部署硬體。 本章說明其判斷依據。
一、依任務的變化程度判斷
策略選擇的主要依據為任務在推論階段的變化程度。
動作固定、環境穩定的任務:ACT
適用情境為工件固定於治具的特定格位、光源由廠內固定燈具提供、機械臂每次依循相同軌跡。產線上的取放工站、插件作業、鎖螺絲前的定位等均屬此類。
此類任務所需者為動作的重複穩定性。ACT 透過學習示範軌跡達成此一目標,無須對場景進行語意層級的判斷。
物件位置或外觀存在變化的任務:GR00T N1.5
適用情境為料件由人工投放而位置不固定、同一工站需處理多種尺寸的零件,或現場光線隨時段變化。
此類任務所需者為對場景的判斷能力。GR00T N1.5 為 NVIDIA 以大規模機器人資料預訓練的基礎模型,具備通用的機器人動作能力,可解讀文字指令與畫面內容後再決定動作,因此對物件位置或外觀的變化具有較高的容受度。
判斷基準為推論階段的變化程度,而非錄製階段。若示範時刻意將工件固定於同一位置,但實際上線後改由人工隨手放置,應依實際情況選擇 GR00T,並於錄製時將位置變化納入示範。
二、依可負擔的示範次數判斷
示範錄製為人力成本,須由操作者逐次帶動 Leader Arm 完成任務,無法自動化。
| 項目 | ACT | GR00T N1.5 |
|---|---|---|
| 學習方式 | 從零學習該套動作 | 於既有的通用能力上進行微調 |
| 示範次數需求 | 較多,須累積數十次以達成穩定度 | 較少,少量示範即可完成微調 |
| 錄製工時 | 高 | 低 |
| 對示範一致性的要求 | 高。各次動作差異過大將影響學習結果 | 相對寬鬆 |
須留意的是,GR00T 所需的示範次數較少,並不代表對示範品質的要求較低。示範次數減少時,單次示範在資料集中所占的權重相應提高:於五次示範中若有一次存在動作猶豫,即代表百分之二十的資料存在品質問題。
若人力條件不足以支應數十次的實體錄製,可考慮採用模擬環境的合成資料生成。
三、依部署目標判斷
本節為策略選擇中影響最為深遠的一項判斷依據。
平台提供兩條部署轉換路徑,每條路徑僅接受一種策略:
圖中裝置右側的徽章標示該裝置是否需要轉換:DIRECT 為可直接執行,CONVERT 為須先完成模型轉換。GPU (CUDA) 為兩條路徑唯一的交會點,兩種策略均可於其上直接執行,亦為推論驗證建議的起始裝置。
除該點之外,兩條路徑不存在交叉:平台未提供將 ACT 模型轉換為 TensorRT,亦未提供將 GR00T 模型轉換為 OpenVINO 的路徑。圖中未連線者即為不支援的組合。
據此,部署目標與策略的對應關係如下:
| 部署目標 | 轉換路徑 | 必須採用的策略 |
|---|---|---|
| Intel 平台的邊緣裝置(未配置獨立顯示卡,對成本與功耗敏感) | OpenVINO | ACT |
| NVIDIA Jetson AGX Thor 等邊緣平台(節拍嚴苛、多路影像) | TensorRT | GR00T N1.5 |
| 配有 NVIDIA 顯示卡的工作站(暫不涉及邊緣部署) | 無須轉換 | 兩者皆可 |
訓練頁與推論頁的裝置清單不同
訓練頁僅列出 GPU (CUDA) 與 CPU;主機無 CUDA 時則為 GPU (OpenVINO) 與 CPU。GPU (TensorRT) 僅在推論頁出現,因其屬於部署階段的設定。於訓練頁未見該選項屬正常情況。
四、決策對照表
| 條件 | 建議策略 |
|---|---|
| 工件位置固定、動作重複性高 | ACT |
| 工件位置或外觀每次不同 | GR00T N1.5 |
| 現場僅能配置 Intel 邊緣裝置 | ACT(唯一可行的 OpenVINO 路徑) |
| 現場為 NVIDIA Jetson 平台、節拍要求嚴苛 | GR00T N1.5 |
| 人力充足,可錄製數十次示範 | 兩者皆可,依前述條件判斷 |
| 僅能錄製少量示範 | GR00T N1.5 |
| 導入評估階段 | ACT。訓練時間短、硬體門檻低,適合首輪驗證 |
| 需比較兩者在同一批資料上的表現 | 兩者各訓練一次 |
於同一批資料上比較兩種策略
平台未限制此一作法。資料集採 LeRobot 標準格式,兩種策略讀取的為同一份資料,僅需於訓練頁更換策略與輸出資料夾名稱後重新執行。對於尚未確定部署硬體的專案,此為成本最低的評估方式,代價僅為額外的訓練時間與磁碟空間。
總結
ACT 與 GR00T N1.5 並非同一能力層級的不同版本,而是面對不確定性的兩種取徑:前者著重於動作軌跡的重複精度,後者著重於場景理解後的決策。任務的變化程度決定何者適用,而現場可配置的硬體則構成硬性限制。
由於產線硬體規格通常於專案初期即已定案,策略選擇在多數情況下並非開放選項,而是由部署條件反向決定。若部署硬體尚未確定,建議先以 ACT 完成一輪完整流程,藉以取得對任務複雜度的實測依據。
下一步: 模擬錄製與 SDG.