中文

CoA-VLA:通过 Visual-Textual Chain-of-Affordance 提升视觉-语言-动作模型

机器人学 2025-08-01 v2

摘要

机器人基础模型,特别是视觉-语言-动作(VLA)模型,因其增强机器人策略学习能力而受到广泛关注,显著提高机器人的泛化和鲁棒性。OpenAI 最近的 O1 模型展示了利用大量推理链解决复杂问题的惊人能力。这引发了一个重要问题:机器人模型能否通过回顾先前观察并提供任务特定推理来指导动作预测,从而在多任务、复杂环境中实现更好性能?本文引入 Chain-of-Affordance(CoA-VLA),这是一种通过将推理格式化为顺序机器人可供给(affordance)来扩展机器人模型的新方法,以促进任务完成。具体而言,我们要求模型在采取行动前考虑以下四种类型的可供给:(1)对象可供给——操作什么对象以及其位置;(2)抓取可供给——具体抓取对象的部件;(3)空间可供给——放置对象的最优空间;(4)运动可供给——运动的碰撞自由路径。我们进一步将每个可供给转换为两种提示格式:视觉可供给和文本可供给。我们引入一种新型视觉-语言共注入模块,将此类知识整合到策略网络中。这使机器人能够在推理期间利用关键上下文信息,结果在精度和鲁棒性方面均得到提高。我们的实验表明,CoA-VLA 在各种任务上均优于最先进的机器人基础模型,包括 OpenVLA 和 Octo。此外,CoA-VLA 在识别未见对象姿态、识别自由空间和在新环境中避障方面表现出强大的泛化能力。

关键词

引用

@article{arxiv.2412.20451,
  title  = {CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance},
  author = {Jinming Li and Yichen Zhu and Zhibin Tang and Junjie Wen and Minjie Zhu and Xiaoyu Liu and Chengmeng Li and Ran Cheng and Yaxin Peng and Yan Peng and Feifei Feng},
  journal= {arXiv preprint arXiv:2412.20451},
  year   = {2025}
}

备注

Project webpage is available at https://chain-of-affordance.github.io