跳至主要内容

訓練監控與接續訓練

訓練啟動後,其執行狀態透過頁面底部的狀態列呈現。訓練異常的徵兆通常於執行初期即已顯現,因此在啟動後的前數分鐘進行觀察,可避免無效的長時間執行。

本章說明狀態列各項指標的意義、正常與異常的判別方式,以及接續訓練的適用範圍。

一、狀態列的組成​

訓練狀態列

訓練啟動後,頁面底部顯示常駐的狀態列,包含四類資訊:

顯示項目內容
訓練進度進度條與百分比,依「目前步數 ÷ 設定的總步數」計算
目前步數已完成的訓練步數
訓練損失(Loss)目前的損失值,為判斷學習狀況的主要依據
GPU 狀態各張顯示卡的使用率;游標停留時顯示顯存的已使用、可用與總計

其中進度反映剩餘執行時間,Loss 反映學習狀況,GPU 使用率反映運算資源的利用效率。狀態列最左側另有「結束訓練」按鈕,其用途詳見本章第四節。

狀態列位於頁面底部而非獨立頁面,因此訓練進行中仍可捲動上方區域檢視本次訓練所使用的資料集與參數設定,無須中斷訓練。

二、Loss 的判讀​

定義​

Loss(損失值)衡量模型預測的動作與示範動作之間的差距。數值越小,代表模型的預測越接近示範內容。訓練過程中 Loss 應呈持續下降的趨勢。

三種常見的曲線形態​

其一,穩定下降後趨於平坦。 此為正常形態:初期快速下降,中期趨緩,後期於小範圍內波動。當曲線已平坦一段時間且無明顯改善時,代表模型於該批資料上的學習已趨於飽和,繼續訓練的邊際效益有限。

其二,未呈現下降趨勢或持續震盪。 此為異常形態,常見成因如下:

可能成因確認方式
批次大小過小,單次更新的方向受個別樣本影響調高批次大小後執行短時間測試
資料品質不一致,示範動作差異過大回頭至資料工具逐集播放檢查
策略選擇不符任務性質,例如高變異任務採用 ACT參閱策略選擇的判斷依據

其三,下降至特定點後開始上升。 此形態通常代表過度擬合:模型開始記憶訓練資料中的偶然特徵,並因此喪失對變化情況的處理能力。此種情況下,表現最佳的模型為上升前的存檔點,此亦為保存頻率不宜設定過疏的實質原因。

兩種策略的 Loss 差異​

ACT 由零開始學習,Loss 的起始值較高,下降幅度較大;GR00T N1.5 於預訓練模型上進行微調,起始即具備相當的能力,因此 Loss 的起始值較低,下降幅度亦顯著較小。

警告

不同策略的 Loss 數值不具可比性。GR00T 的 Loss 下降幅度較小為微調的正常表現,不代表學習未生效。

比較兩種策略的優劣時,唯一有效的方式為實際執行推論並評估手臂表現。Loss 的比較僅在同一策略、同一資料集的不同次訓練之間具有意義。

三、GPU 使用率的判讀​

Loss 反映學習成效,GPU 使用率則反映運算資源是否被有效利用。

觀察到的現象通常代表處理方式
使用率持續偏高正常,GPU 為運算瓶頸無須處理
使用率波動大且平均偏低資料供給不足,GPU 於批次之間等待資料ACT:調高「資料載入執行緒數」。GR00T:訓練頁未提供該欄位,應改由資料集的存放位置著手,例如避免置於低速磁碟
顯存接近滿載批次大小已接近上限目前可執行即無須調整,惟不宜再提高批次大小,亦不應同時執行第二個訓練作業
使用率為零或極低可能誤選為 CPU 裝置檢查訓練頁的裝置選擇

於多張顯示卡的環境下,狀態列將分別顯示各張卡的使用率,游標停留可檢視該卡的顯存細節,此為判斷批次大小是否仍有調整空間的直接依據。

四、提前結束訓練的時機​

「結束訓練」按鈕將提前中止訓練,並保留已完成的進度存檔。

適用的情況有三:

其一,Loss 已平坦相當時間。 剩餘步數不會帶來明顯改善,將時間配置於推論驗證的效益較高。

其二,執行初期即出現明顯異常。 例如 Loss 完全無變化,或 GPU 使用率為零。此類徵兆於前數分鐘即可觀察到,其成因位於設定或資料,繼續執行不會使情況改善。

其三,發現參數設定錯誤。 例如選用 GR00T 卻沿用十萬步的設定。

不適用的情況為僅因執行時間較長而欲檢視中間結果。訓練中途的模型能力尚未完整,此時中止並執行推論所觀察到的表現不足以代表該批資料的實際效果,反而可能導致對策略或資料的誤判。

中止後系統將顯示「訓練已提前中止」的提示,已完成的存檔仍可使用。

五、接續訓練​

適用時機​

  • 訓練遭中斷:停電、主機需重新啟動,或手動停止以釋出運算資源。
  • 訓練步數不足:訓練已完成,但 Loss 於結束時仍明顯下降。
  • 需暫時釋出運算資源:於特定時段將 GPU 配置予其他作業,後續再行接續。

操作方式​

於訓練頁的「訓練模式」選擇「繼續訓練」後指定進度存檔:

  1. 以「瀏覽」找出欲接續的存檔。
  2. 選定後平台將自動載入,畫面以「模型名 / 步數」標示所選的存檔。
  3. 確認帶回的原始參數無誤。
  4. 點選「開始訓練」。

須確認第 2 步所顯示的「模型名 / 步數」為預期的存檔。單次訓練會產生多個存檔點,若選取錯誤,訓練將由非預期的進度接續,且系統不會提示異常。

不適用接續訓練的情況​

接續訓練的性質為延長同一次訓練,而非修正該次訓練。以下情況應建立新的訓練作業:

情況原因
更換資料集,例如補錄新的示範接續將沿用原有的訓練狀態,於更換資料後接續,結果不易解釋
欲修改參數後重新執行載入存檔將帶回原始參數,接續的定義即為延續原設定
Loss 未下降,欲延長訓練時間觀察未下降的成因通常位於資料或策略,延長訓練不會改變結果
更換策略ACT 與 GR00T 的存檔格式不相容

判斷原則為:欲變更訓練的對象或方式時,應建立新的訓練;僅在變更訓練時長時,方適用接續訓練。

六、訓練結束後的處理​

訓練結束摘要

訓練完成時,平台將顯示「訓練已結束」摘要視窗,內容為最終 Loss Rate 與前往推論頁面的連結。

建議於關閉該視窗前記錄此數值,並一併記下本次訓練所用的策略、資料集與總步數——後三項不會出現於摘要視窗中。於後續訓練第二版、第三版模型時,該紀錄為版本比較的唯一依據,且比較須於同一策略、同一資料集之間進行方具意義。

訓練階段的所有數值均為間接指標,模型的實際可用性須透過推論驗證確認。


下一步: 實機驗證.