中文

Cosmos Policy:细调视频模型以实现视觉-运动控制与规划

人工智能 2026-01-23 v1 机器人学

摘要

最近的视频生成模型显示出捕捉复杂物理相互作用和时空场景演化的显著能力。为利用其时空先验,机器人领域的工作已将视频模型用于策略学习,但通过要求多个后训练阶段和新的架构组件来实现动作生成,从而引入复杂性。本文提出Cosmos Policy,一种简单的方法,通过在目标平台上收集的机器人演示数据上的单一后训练阶段,将大型预训练视频模型(Cosmos-Predict2)适配为有效的机器人策略,无需架构修改。Cosmos Policy学习直接生成编码为视频模型潜在扩散过程中潜在帧的机器人动作,充分利用模型的预训练先验和核心学习算法以捕捉复杂动作分布。此外,Cosmos Policy生成未来状态图像和价值(预期累积奖励),同样编码为潜在帧,使其能够在测试时规划动作轨迹,以提高成功概率。在我们的评估中,Cosmos Policy在LIBERO和RoboCasa仿真基准测试中实现了最先进的性能(分别为98.5%和67.1%的平均成功率),并在挑战性的真实世界双臂操作任务中取得最高平均得分,超过了从头训练的强扩散策略、基于视频模型的策略以及在相同机器人演示数据上微调的视觉-语言-动作模型。此外,给定策略 rollout数据,Cosmos Policy可以从经验中学习,以细化其世界模型和价值函数,并利用基于模型的规划以实现更高的挑战性任务成功率。我们在https://research.nvidia.com/labs/dir/cosmos-policy/发布代码、模型和训练数据。

关键词

引用

@article{arxiv.2601.16163,
  title  = {Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning},
  author = {Moo Jin Kim and Yihuai Gao and Tsung-Yi Lin and Yen-Chen Lin and Yunhao Ge and Grace Lam and Percy Liang and Shuran Song and Ming-Yu Liu and Chelsea Finn and Jinwei Gu},
  journal= {arXiv preprint arXiv:2601.16163},
  year   = {2026}
}