中文

揭示具身推理在视觉语言动作模型中的幻象

机器人学 2026-04-21 v1

摘要

近期视觉语言动作(VLA)模型在标准机器人基准测试中取得惊人的成功率,推动了对通用物理智能的乐观预期。然而,近期证据表明,标准基准测试成功与真正具身推理之间存在系统性偏离,质疑这些高分是否反映出真正的认知能力。为弥合这一差距,我们引入BeTTER——一个诊断性基准,用于测试真正的具身推理在机器人策略中的表现。BeTTER通过强制执行运动学隔离,应用有针对性的因果干预(如空间布局偏移、时间外推),以显式解耦高级推理失败与低级执行限制。通过系统评估,我们揭示了最先进的VLAs在动态场景中会 catastrophic fail,表现出严重的词汇-运动学捷径、行为惰性和语义特征坍塌。关键在于,我们的机制分析将这些症状追溯到根本性的架构瓶颈——如容量压缩和盲目下采样——这些瓶颈系统性地降低了模型基础语义表示的质量。我们演示了高度静态的评估协议有效地掩盖了这种降解,通过允许优化过度拟合感知运动先例。基于真实世界机器人验证,我们的发现确认,这种表征性崩溃并非仿真制造 artifact,凸显了未来VLA范式必须解决高频率控制与高级推理之间结构性张力的关键需求。

关键词

引用

@article{arxiv.2604.18000,
  title  = {Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models},
  author = {Haiweng Xu and Sipeng Zheng and Hao Luo and Wanpeng Zhang and Ziheng Xi and Zongqing Lu},
  journal= {arXiv preprint arXiv:2604.18000},
  year   = {2026}
}