中文

从推理到动作:基于视觉草图的长期机器人操作

机器人学 2026-01-06 v1

摘要

长期机器人操作正在成为实际部署的关键需求,需要在复杂布局中实现空间消歧,并在动态交互下保持时间韧性。然而,现有的端到端和分层视觉语言-动作(VLA)策略往往依赖文本级别的线索,同时保持计划意图潜在,这削弱了在杂乱或不明确场景中的参考 grounding,阻碍了长期目标任务分解的有效性,特别是对于具有闭环交互的目标,限制了通过隐蔽动作选择背后原因的因果解释。为此,我们首先引入视觉草图(Visual Sketch),这是一种不合常理的视觉中间形式,用于渲染点的、框、箭头和已标记关系,以外部化空间意图,将语言与场景几何连接起来。在视觉草图之上,我们提出 Action-Sketcher,一种 VLA 框架,其 operates in 一个循环的 See-Think-Sketch-Act 工作流程,通过自适应的 token-gated 策略协调推理触发、草图修订和动作发布,从而支持反应性纠正和人类交互,同时保持实时动作预测。为实现可扩展的训练和评估,我们收集了包含交错图像、文本、视觉草图监督和动作序列的多样化语料库,并通过一种结合了用于模态统一的交错序列对齐、语言到草图一致性以实现精确语言 grounding,以及与草图到动作强化学习结合的模仿学习的多阶段课程食谱来训练 Action-Sketcher。在杂乱场景和多目标任务上的大量实验表明,Action-Sketcher 在提高长期成功率、增强对动态场景变化的鲁棒性方面取得显著效果,并通过可编辑草图和分步计划增强了可解释性。项目网站: https://action-sketcher.github.io

关键词

引用

@article{arxiv.2601.01618,
  title  = {Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation},
  author = {Huajie Tan and Peterson Co and Yijie Xu and Shanyu Rong and Yuheng Ji and Cheng Chi and Xiansheng Chen and Qiongyu Zhang and Zhongxia Zhao and Pengwei Wang and Zhongyuan Wang and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2601.01618},
  year   = {2026}
}

备注

26 pages, 14 figures