中文

Chain-of-Action:用于机器人操作的轨迹自回归建模

机器人学 2026-01-07 v2 计算机视觉与模式识别 机器学习

摘要

我们提出了Chain-of-Action(CoA),一种基于轨迹自回归建模的新型视觉-运动策略范式。与传统的前向预测下一步动作的方法不同,CoA通过显式的反向推理,利用任务特定目标,通过动作层面的思维链(Chain-of-Thought, CoT)过程生成完整轨迹。该过程统一在单一自回归结构中:(1)第一个token对应一个稳定的关键帧动作,用于编码任务特定目标;(2)后续动作token以初始关键帧和先前预测动作为条件,自回归地生成。这种反向动作推理强制了全局到局部的结构,使每个局部动作都受到最终目标的严格约束。为了进一步实现动作推理结构,CoA融合了四种互补设计:连续动作token表示;用于变长轨迹生成的动态停止;反向时间集成;以及多token预测以平衡动作块建模与全局结构。因此,CoA在保留视觉-运动策略的灵活性和简洁性的同时,具备强大的空间泛化能力。经验上,我们观察到CoA在60个RLBench任务和8个真实世界操作任务上取得了最先进性能。

关键词

引用

@article{arxiv.2506.09990,
  title  = {Chain-of-Action: Trajectory Autoregressive Modeling for Robotic Manipulation},
  author = {Wenbo Zhang and Tianrun Hu and Hanbo Zhang and Yanyuan Qiao and Yuchu Qin and Yang Li and Jiajun Liu and Tao Kong and Lingqiao Liu and Xiao Ma},
  journal= {arXiv preprint arXiv:2506.09990},
  year   = {2026}
}