可及性场干预:使视觉-语言-动作模型在机器人操作中逃离记忆陷阱
机器人学
2025-12-09 v1 机器学习
摘要
视觉-语言-动作(VLA)模型通过将视觉观测和语言指令直接映射到动作,在机器人操作中展现了出色的性能。然而,在分布偏移下它们仍然脆弱:当测试场景发生变化时,VLA 往往复现记忆化的轨迹而非适应更新后的场景,这一失败模式我们称之为"记忆陷阱"。这一限制源于端到端设计,缺乏显式的三维空间推理,无法在不熟悉的环境中可靠地识别可操作区域。为弥补这种缺失的空间理解,三维空间可及性场(SAF)可以提供一种几何表示,突出显示交互在物理上可行的位置,为机器人应接近或远离的区域提供明确提示。因此,我们提出了可及性场干预(AFI),一个轻量级混合框架,将 SAF 作为按需插件来引导 VLA 行为。我们的系统通过本体感知检测记忆陷阱,将机器人重新定位到近期高可及性区域,并提出可及性驱动的航路点以锚定 VLA 生成的动作。基于 SAF 的评分器随后选择累积可及性最高的轨迹。大量实验表明,我们的方法在不同 VLA 骨干网络( 和 )下的分布外真实机器人平台上平均提升了 23.5%,在 LIBERO-Pro 基准上提升了 20.2%,验证了其在增强 VLA 对分布偏移鲁棒性方面的有效性。
引用
@article{arxiv.2512.07472,
title = {Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation},
author = {Siyu Xu and Zijian Wang and Yunke Wang and Chenghao Xia and Tao Huang and Chang Xu},
journal= {arXiv preprint arXiv:2512.07472},
year = {2025}
}