从意图到执行:探究视觉-语言-行动模型的泛化边界
机器人学
2025-06-12 v1 计算机视觉与模式识别
摘要
视觉-语言-行动(VLA)模型相对于传统机器人模仿学习的一个承诺是,利用大型视觉-语言模型(VLM)的广泛泛化能力来产生多功能的“通才”机器人策略。然而,目前对VLA的评估仍然不足。传统的模仿学习基准由于缺乏语言指令而不适用。新兴的包含语言的VLA基准通常带有有限的评估任务,并且不打算调查VLM预训练在多大程度上真正有助于下游机器人策略的泛化能力。同时,许多研究依赖于不同机构孤立设计的真实世界机器人设置,这为可重复性和可访问性创造了障碍。为了解决这一差距,我们引入了一个统一的探测套件,包含跨越语言指令、视觉和物体10个子类别的50个基于模拟的任务。我们在此套件上系统地评估了几种最先进的VLA架构,以了解它们的泛化能力。我们的结果表明,虽然VLM骨干赋予VLA强大的感知理解和高级规划(我们称之为良好意图),但这并不能可靠地转化为精确的电机执行:当面对分布外观察时,策略通常表现出连贯的意图,但在动作执行上却步履蹒跚。此外,对动作数据的微调可能会侵蚀原始VLM的通才推理能力。我们发布我们的任务套件和评估代码,以作为未来VLA的标准化基准,并推动关于缩小感知到行动差距的研究。更多信息,包括源代码,可以在 https://ai4ce.github.io/INT-ACT/ 找到。
引用
@article{arxiv.2506.09930,
title = {From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models},
author = {Irving Fang and Juexiao Zhang and Shengbang Tong and Chen Feng},
journal= {arXiv preprint arXiv:2506.09930},
year = {2025}
}
备注
Under review