通过训练-free 注意力再调节恢复 VLA 模型中的语言 grounding
机器人学
2026-03-09 v1 人工智能
计算机视觉与模式识别
摘要
视觉语言-动作 (VLA) 模型使机器人能够从自然语言指令中直接执行操作任务,越来越被视为通用机器人策略的基础。然而,这些模型在外分布 (OOD) 指令下的可靠性尚未得到充分探索。本文揭示了 VLA 策略在面对语言指令与场景矛盾时,仍继续执行在视觉上合理但不符合指令语义的动作的关键失效模式。我们称这种现象为语言盲目 (linguistic blindness),即 VLA 策略在动作生成过程中优先考虑视觉先验而非指令语义。为系统分析此问题,我们引入了 ICBench,一个从 LIBERO 数据集构建的诊断基准,通过注入受控的 OOD 指令矛盾而保持视觉环境不变,以探测语言-动作之间的耦合。对三个代表性 VLA 架构 (包括 Pi0、Pi0.5 和 OpenVLA OFT) 的评估表明,这些模型在逻辑上不可能的指令下仍成功完成任务,揭示了动作生成中强烈的视觉偏见。为缓解此问题,我们提出了一种指令引导注意力再调节 (Instruction-Guided Attention Recalibration, IGAR) 方法,一种无需训练的推理时机制,用于重新平衡注意力分布以恢复语言指令的影响。IGAR 无需重新训练或修改网络结构,可直接应用于现有的 VLA 模型。跨 30 个 LIBERO 任务的实验表明,IGAR 在 OOD 对抗性指令下显著减少了错误执行,同时保持了基线任务性能。我们 additionally 在真实的 Franka 机器人臂上验证了该方法,IGAR 有效防止了由不一致指令触发的误操作。
引用
@article{arxiv.2603.06001,
title = {Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration},
author = {Ninghao Zhang and Bin Zhu and Shijie Zhou and Jingjing Chen},
journal= {arXiv preprint arXiv:2603.06001},
year = {2026}
}