中文

视觉-语言-动作模型虽受局限,却能泛化至新颖指令

机器人学 2026-05-04 v5

摘要

视觉-语言-动作模型(VLA)通常在已演示任务上取得高性能,但在需要外推、以新颖方式组合从不同任务中学到的技能时却表现挣扎。例如,VLA 可能成功地将奶油奶酪放入碗中,并将碗放在橱柜顶部,但仍无法将奶油奶酪放在橱柜顶部。在这项工作中,我们证明,通过在推理时操纵 VLA 的内部表征,可以有效重组来自不同任务的行为。具体而言,我们通过对特定基础任务的所有演示轨迹中文本令牌的隐藏状态进行平均,来识别文本潜变量。为了执行外推任务,我们可以在时间上对两个基础任务的文本潜变量进行插值,并将其加回文本隐藏状态,从而使两个任务的子行为依次被激活。我们使用新创建的 libero-ood 基准评估此方法,该基准包含从标准 LIBERO 套件外推得到的 20 个任务。在 libero-ood 上的结果表明,所有最先进的 VLA 成功率均低于 15%,而采用文本潜变量插值的 π0\pi0 模型成功率达到了 83%。进一步的定性分析揭示,VLA 倾向于表现出空间过拟合,将对象名称映射到已演示的位置,而非实现真正的对象与目标理解。此外,我们发现解码文本潜变量会产生人类不可读的提示,但这些提示仍能指导 VLA 在标准 LIBERO 套件上达到 70% 的成功率,这为私有指令或后门攻击提供了可能。

关键词

引用

@article{arxiv.2505.03500,
  title  = {VLAs are Confined yet Capable of Generalizing to Novel Instructions},
  author = {Quanyi Li},
  journal= {arXiv preprint arXiv:2505.03500},
  year   = {2026}
}