中文

别带苹果,别带沙发:无关上下文对嵌入式 AI 命令对大型视觉-语言-动作模型的影响

机器人学 2025-10-09 v1

摘要

视觉-语言-动作(VLA)模型在嵌入式 AI 中广泛应用,使机器人能够解释并执行语言指令。然而,这些模型在现实场景中面对自然语言变体的鲁棒性尚未得到充分调查。本文提出了一项新颖的系统性研究,系统评估最新 VLA 模型在语言扰动下的鲁棒性。具体而言,我们评估了在两种指令噪声下的模型性能:(1)人类生成的改写,和(2)添加无关上下文。我们进一步根据上下文长度及其与机器人指令的语义和词汇接近程度,将无关上下文分为两组。在本研究中,我们观察到随着上下文规模扩大,性能 consistently 下降。我们还展示了模型对随机上下文具有相对鲁棒性,性能下降不超过 10%,而语义和词汇相似且长度相同的上下文可导致约 50% 的质量下降。人类对指令的改写导致近 20% 的性能下降。为缓解此问题,我们提出了一个基于大语言模型的过滤框架,从噪声输入中提取核心指令。将我们的过滤步骤纳入模型后,可在噪声条件下恢复最高 98.5% 的原始性能。

关键词

引用

@article{arxiv.2510.07067,
  title  = {Bring the Apple, Not the Sofa: Impact of Irrelevant Context in Embodied AI Commands on VLA Models},
  author = {Daria Pugacheva and Andrey Moskalenko and Denis Shepelev and Andrey Kuznetsov and Vlad Shakhuro and Elena Tutubalina},
  journal= {arXiv preprint arXiv:2510.07067},
  year   = {2025}
}