中文

揭示视觉语言动作模型在开放式多模态指令下的潜力

机器人学 2025-05-19 v1

摘要

视觉语言动作模型(Vision-Language-Action, VLA)模型近年来在机器人领域取得了高度突破。利用在大规模互联网数据上训练的视觉语言基础模型,VLA模型可以通过单一的端到端神经网络,从视觉观察和人类指令直接生成机器人动作。尽管这些模型效果显著,但当前的VLA模型通常仅接受一种形式的人类提示——语言指令,这可能限制其在开放式人机交互场景中的应用。例如,用户可能希望机器人从图像中检索物体、跟随白板上的指令、或模仿视频中演示的行为,而不仅仅依赖语言描述。为此,我们引入了OE-VLA模型,探索VLA模型在开放式多模态指令下的潜力。大量实验结果表明,我们的OE-VLA不仅在语言输入条件下表现出与传统VLA模型相当的性能,还在四类额外的开放式任务中取得了令人印象深刻的成绩。该方法的提出将显著拓展VLA模型在各种日常场景中的应用范围,并促进人机交互的实现。

关键词

引用

@article{arxiv.2505.11214,
  title  = {Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions},
  author = {Wei Zhao and Gongsheng Li and Zhefei Gong and Pengxiang Ding and Han Zhao and Donglin Wang},
  journal= {arXiv preprint arXiv:2505.11214},
  year   = {2025}
}