中文

PosA-VLA:通过姿态条件锚点注意力增强动作生成

计算机视觉与模式识别 2025-12-09 v2 机器人学

摘要

视觉-语言-动作(VLA)模型在具身任务中已展现出显著性能,并显示出在现实应用中的巨大潜力。然而,当前的VLA模型仍然难以生成一致且精确的目标导向动作,因为它们经常沿轨迹生成冗余或不稳定的运动,这限制了其在时间敏感场景中的应用。在本工作中,我们将这些冗余动作归因于现有VLA模型的空间均匀感知场,这导致它们在复杂环境中被目标无关物体所干扰。为了解决这一问题,我们提出了高效的PosA-VLA框架,通过姿态条件监督来锚定视觉注意力,持续引导模型的感知朝向任务相关区域。姿态条件锚点注意力机制使模型能够更好地对齐指令语义与可操作的视觉线索,从而提高动作生成的精确性和效率。此外,我们的框架采用轻量级架构,无需辅助感知模块(如分割或定位网络),确保了高效的推理。大量实验验证了我们的方法在多样化机器人操作基准测试中以精确且高效的方式执行具身任务,并在各种具有挑战性的环境中展现出强大的泛化能力。

关键词

引用

@article{arxiv.2512.03724,
  title  = {PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention},
  author = {Ziwen Li and Xin Wang and Hanlue Zhang and Runnan Chen and Runqi Lin and Xiao He and Han Huang and Yandong Guo and Fakhri Karray and Tongliang Liu and Mingming Gong},
  journal= {arXiv preprint arXiv:2512.03724},
  year   = {2025}
}