用于无动作预训练的物理自回归模型
计算机视觉与模式识别
2025-09-09 v4
摘要
操作数据的稀缺性促使使用来自其他模态的预训练大型模型用于机器人。本文基于自回归视频生成模型提出了物理自回归模型(PAR),其中物理记号将帧和动作组合起来表示机器人及其环境的联合演化。PAR利用视频预训练中嵌入的世界知识来理解物理动态,而无需进行动作预训练,从而实现准确的视频预测和一致的动作轨迹。它还采用基于DiT的去记号化器来建模帧和动作作为连续记号,缓解量化误差并促进相互增强。此外,我们采用逆运动学的因果掩码、并行训练和KV缓存机制进一步提高性能和效率。在ManiSkill基准上的实验表明,PAR在PushCube任务上实现了100%的成功率,在其他任务上与动作预训练基线相当,并准确预测未来视频,动作轨迹紧密对齐。这些发现凸显了通过从自回归视频预训练传递世界知识进行机器人操作控制的前景。项目页面请参见:https://hcplab-sysu.github.io/PhysicalAutoregressiveModel/。
引用
@article{arxiv.2508.09822,
title = {Physical Autoregressive Model for Robotic Manipulation without Action Pretraining},
author = {Zijian Song and Sihan Qin and Tianshui Chen and Liang Lin and Guangrun Wang},
journal= {arXiv preprint arXiv:2508.09822},
year = {2025}
}
备注
16 pages, 6 figures