CARP:通过粗到细自回归预测进行视觉运动策略学习
机器人学
2025-08-12 v3 计算机视觉与模式识别
摘要
在机器人视觉运动策略学习中,基于扩散的模型已在提高动作轨迹生成的准确性方面取得了显著成功,优于传统自回归模型。然而,它们由于多次去噪步骤和复杂约束带来的灵活性限制而效率低下。在本文中,我们提出了粗到细自回归策略(CARP),一种重新定义自回归动作生成过程为粗到细、下一尺度方法的视觉运动策略学习新范式。CARP 将动作生成解耦为两个阶段:首先,动作自编码器学习整个动作序列的多尺度表示;然后,一个 GPT 风格的 Transformer 通过粗到细的自回归过程细化序列预测。这种简单直观的方法产生了高度准确且平滑的动作,在匹配甚至超越基于扩散的策略性能的同时,保持了与自回归策略相当的推理效率。我们在多种设置下进行了广泛评估,包括基于状态和基于图像的仿真基准上的单任务和多任务场景,以及真实世界任务。CARP 取得了具有竞争力的成功率,成功率提升高达 10%,并且推理速度比现有最优策略快 10 倍,为机器人任务中的动作生成建立了高性能、高效且灵活的范式。
引用
@article{arxiv.2412.06782,
title = {CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction},
author = {Zhefei Gong and Pengxiang Ding and Shangke Lyu and Siteng Huang and Mingyang Sun and Wei Zhao and Zhaoxin Fan and Donglin Wang},
journal= {arXiv preprint arXiv:2412.06782},
year = {2025}
}