TAG:面向目标无关的指引,实现视觉-语言-动作模型中稳定的面向对象推理
计算机视觉与模式识别
2026-03-26 v1 机器人学
摘要
视觉-语言-动作(VLA)策略在将语言指令和视觉观测映射到机器人动作方面显示出强大的进步,但在 cluttered 场景中可靠性会下降。通过分析失败案例,我们发现许多错误并不源于不可行的运动,而是源于实例级对齐失败:策略常常会产生一个略微偏离目标甚至在错误对象上的合理抓取轨迹。为此,我们提出了 TAG(Target-Agnostic Guidance),一种简单的推理时指引机制,显式地减少由 distractor 和 appearance 引起的偏差。灵感来自分类无指引(CFG),TAG 通过对原始观测和被删除对象后的观测之间的策略预测进行对比,其差异作为残差驾驶信号,用于强化对象证据在决策过程中的影响。TAG 不需要修改策略架构即可集成到现有的 VLA 策略中,仅需最小程度的训练和推理更改。在标准操作基准测试中评估,包括 LIBERO、LIBERO-Plus 和 VLABench,TAG 在 clutter 条件下一致地提高了鲁棒性,减少了 near-miss 和错误对象执行。
引用
@article{arxiv.2603.24584,
title = {TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models},
author = {Jiaying Zhou and Zhihao Zhan and Ruifeng Zhai and Qinhan Lyu and Hao Liu and Keze Wang and Liang Lin and Guangrun Wang},
journal= {arXiv preprint arXiv:2603.24584},
year = {2026}
}