Vision-Language-Action Model
読み方は「ビジョンランゲージアクションモデル」。意味と使われ方を根拠つきで確認できます。
複数資料で一致
30秒で分かる答え
Vision-Language-Action Modelは、画像や動画などの視覚情報と言語指示を受け取り、ロボットの動作や行動系列を出力するモデルです。VLAと略されます。認識だけを行うVision-Language Modelとは異なり、実際の行動生成や制御との接続を扱いますが、制御周期や安全機構は実装ごとに異なります。
視覚と言語を受け取りロボットの行動へ変換するAIモデル
Vision-Language-Action Modelの意味・使い方
要点と背景
視覚と言語を受け取りロボットの行動へ変換するAIモデル
Vision-Language-Action Modelは、カメラなどから得た視覚情報と、人間の言語指示、ロボットの状態などを組み合わせ、ロボットが実行する行動や動作系列を出力するモデルです。Google DeepMindのGemini RoboticsやNVIDIAのGR00Tは、視覚・言語理解をロボットの行動へ結びつけるモデルの例として紹介されています。VLAはVision-Language Modelの出力を単に読み上げる仕組みではなく、関節、手先、移動、把持、軌道など、身体に依存するアクション表現を扱います。一方、モデルが返す行動は、低レベルのモーター制御まで直接含む場合も、別のコントローラーへ目標を渡す場合もあります。対応する身体、制御周期、センサー、動作範囲、訓練データが違うため、VLAという名称だけで異なるロボットへゼロショット転移できるとは限りません。現実の実行前に制約、安全判定、停止、失敗検知を組み込みます。
使われる分野・文脈
掲載データの使用場面
確認時の注意
断定を避けるポイント
Google DeepMindとNVIDIAの公式資料で、視覚・言語を物理的行動へつなぐモデルとして整理した。低レベル制御まで含むかは実装ごとに確認する。
関連する用語
同じ分野・使用文脈から探す
根拠資料と確認状況
確認日・出典
複数資料で一致
最終確認2026/8/21
読み方と意味を、
分けて確認。
正式名称、意味、使われる分野を分けて記録しています。