VideoWorld 2:从真实世界视频中学习可迁移知识
计算机视觉与模式识别
2026-02-11 v1
摘要
从无标签视频数据中学习可迁移知识并在新环境中应用,是智能体的基本能力。本 work 提出 VideoWorld 2,该模型扩展了 VideoWorld,首次针对从原始真实世界视频中学习可迁移知识进行系统性研究。VideoWorld 2 引入动态增强的潜在动力学模型 (dynamic-enhanced Latent Dynamics Model, dLDM),该模型将动作动力学与视觉外观解耦:预训练的视频扩散模型处理视觉外观建模,从而使 dLDM 能够学习聚焦于紧凑且有意义任务相关动力学的潜在代码。这些潜在代码随后以自回归方式建模,以学习任务策略并支持长期推理。在具有挑战性的真实世界手工制作任务上进行评估,其中 prior 视频生成和潜在动力学模型难以可靠运行。惊人地,VideoWorld 2 在任务成功率上实现了最高 70% 的提升,并产生连贯的长时段执行视频。在机器人领域,我们展示了 VideoWorld 2 能够从 Open-X 数据集中获取有效的操作知识,显著提高了 CALVIN 上的任务性能。这一研究揭示了直接从原始视频中学习可迁移世界知识的潜力,所有代码、数据和模型将对外公开以供进一步研究。
引用
@article{arxiv.2602.10102,
title = {VideoWorld 2: Learning Transferable Knowledge from Real-world Videos},
author = {Zhongwei Ren and Yunchao Wei and Xiao Yu and Guixun Luo and Yao Zhao and Bingyi Kang and Jiashi Feng and Xiaojie Jin},
journal= {arXiv preprint arXiv:2602.10102},
year = {2026}
}
备注
Code and models are released at: https://maverickren.github.io/VideoWorld2.github.io/