首頁/Physical AI/VLM、VLA、機械手臂的關係

VLM、VLA、機械手臂的關係

視覺語言模型與視覺語言動作模型,如何把一句話變成手臂的動作序列。

VLM、VLA、機械手臂的關係
本文目錄
  1. VLM:看得懂畫面
  2. VLA:把理解變成動作
  3. 機械手臂在哪一層

VLM:看得懂畫面

VLM(Vision Language Model)同時吃影像與文字,可以回答「畫面裡有幾個零件」「哪一個有刮痕」。它提供的是理解,不是動作。

VLA:把理解變成動作

VLA(Vision Language Action)在 VLM 之上多了動作頭,直接輸出末端位姿或關節指令。訓練資料是人類示範的操作軌跡,因此資料收集本身就是專案的主要工作量。

機械手臂在哪一層

手臂是執行層。無論上面接的是傳統視覺演算法還是 VLA,最後都要換算成運動學可行的路徑,並受限於手臂的工作範圍、負載與重複精度。這也是為什麼理解硬體規格不能跳過。