中文

用于物理 AI 的视频基础模型世界模拟

计算机视觉与模式识别 2026-02-26 v2 人工智能 机器学习 机器人学

摘要

我们介绍了 [Cosmos-Predict2.5],即 Cosmos World Foundation Models for Physical AI 的最新一代。基于流体架构,[Cosmos-Predict2.5] 将 Text2World、Image2World 和 Video2World 生成统一于单一模型中,并利用 [Cosmos-Reason1],一种 Physical AI 视觉语言模型,提供更丰富的文本 grounding 和更细致的世界模拟控制。该模型在 20000 万片精选视频剪辑上训练,并通过强化学习基于后训练进行优化,[Cosmos-Predict2.5] 在视频质量和指令对齐方面均显著优于 [Cosmos-Predict1],模型规模为 2B 和 14B。这些能力使得更可靠的合成数据生成、策略评估以及机器人和自主系统的闭环仿真成为可能。我们进一步扩展了系列 [Cosmos-Transfer2.5],这是一种类似控制网络的框架,用于 Sim2Real 和 Real2Real 世界转换。尽管 [Cosmos-Transfer2.5] 仅为 [Cosmos-Transfer1] 的 3.5 倍,但其视频生成质量更高且在长期视频生成方面更稳健。这些进展将 [Cosmos-Predict2.5] 和 [Cosmos-Transfer2.5] 确立为扩缩本主体智能的多功能工具。为加速 Physical AI 的研究与部署,我们在 https://github.com/nvidia-cosmos/cosmos-predict2.5 和 https://github.com/nvidia-cosmos/cosmos-transfer2.5 上发布了源代码、预训练检查点和精选基准,遵循 NVIDIA Open Model License。我们希望这些开放资源降低采用门槛,促进构建下一代本体智能的创新。

关键词

引用

@article{arxiv.2511.00062,
  title  = {World Simulation with Video Foundation Models for Physical AI},
  author = {NVIDIA and : and Arslan Ali and Junjie Bai and Maciej Bala and Yogesh Balaji and Aaron Blakeman and Tiffany Cai and Jiaxin Cao and Tianshi Cao and Elizabeth Cha and Yu-Wei Chao and Prithvijit Chattopadhyay and Mike Chen and Yongxin Chen and Yu Chen and Shuai Cheng and Yin Cui and Jenna Diamond and Yifan Ding and Jiaojiao Fan and Linxi Fan and Liang Feng and Francesco Ferroni and Sanja Fidler and Xiao Fu and Ruiyuan Gao and Yunhao Ge and Jinwei Gu and Aryaman Gupta and Siddharth Gururani and Imad El Hanafi and Ali Hassani and Zekun Hao and Jacob Huffman and Joel Jang and Pooya Jannaty and Jan Kautz and Grace Lam and Xuan Li and Zhaoshuo Li and Maosheng Liao and Chen-Hsuan Lin and Tsung-Yi Lin and Yen-Chen Lin and Huan Ling and Ming-Yu Liu and Xian Liu and Yifan Lu and Alice Luo and Qianli Ma and Hanzi Mao and Kaichun Mo and Seungjun Nah and Yashraj Narang and Abhijeet Panaskar and Lindsey Pavao and Trung Pham and Morteza Ramezanali and Fitsum Reda and Scott Reed and Xuanchi Ren and Haonan Shao and Yue Shen and Stella Shi and Shuran Song and Bartosz Stefaniak and Shangkun Sun and Shitao Tang and Sameena Tasmeen and Lyne Tchapmi and Wei-Cheng Tseng and Jibin Varghese and Andrew Z. Wang and Hao Wang and Haoxiang Wang and Heng Wang and Ting-Chun Wang and Fangyin Wei and Jiashu Xu and Dinghao Yang and Xiaodong Yang and Haotian Ye and Seonghyeon Ye and Xiaohui Zeng and Jing Zhang and Qinsheng Zhang and Kaiwen Zheng and Andrew Zhu and Yuke Zhu},
  journal= {arXiv preprint arXiv:2511.00062},
  year   = {2026}
}