VLM、VLA、機械手臂的關係
視覺語言模型與視覺語言動作模型,如何把一句話變成手臂的動作序列。
2026-08-296 分鐘VLMVLA機械手臂

本文目錄
- VLM:看得懂畫面
- VLA:把理解變成動作
- 機械手臂在哪一層
VLM:看得懂畫面
VLM(Vision Language Model)同時吃影像與文字,可以回答「畫面裡有幾個零件」「哪一個有刮痕」。它提供的是理解,不是動作。
VLA:把理解變成動作
VLA(Vision Language Action)在 VLM 之上多了動作頭,直接輸出末端位姿或關節指令。訓練資料是人類示範的操作軌跡,因此資料收集本身就是專案的主要工作量。
機械手臂在哪一層
手臂是執行層。無論上面接的是傳統視覺演算法還是 VLA,最後都要換算成運動學可行的路徑,並受限於手臂的工作範圍、負載與重複精度。這也是為什麼理解硬體規格不能跳過。

