VideoWorld:探索从无标注视频中学习知识
计算机视觉与模式识别
2025-03-06 v2
摘要
本工作探讨了深度生成模型能否仅从视觉输入中学习复杂知识,这与当前以大语言模型(LLM)等基于文本的模型为主流的研究焦点形成对比。我们开发了 VideoWorld,这是一个在无标注视频数据上训练的自回归视频生成模型,并在基于视频的围棋和机器人控制任务中测试了其知识获取能力。我们的实验揭示了两个关键发现:(1)仅使用视频训练提供了足以学习知识的信息,包括规则、推理和规划能力;(2)视觉变化的表示对知识获取至关重要。为了提升这一过程的效率和有效性,我们引入了 Latent Dynamics Model(LDM)作为 VideoWorld 的关键组件。值得注意的是,VideoWorld 仅凭一个 3 亿参数的模型,在 Video-GoBench 中达到了 5 段专业水平,且未依赖强化学习中典型的搜索算法或奖励机制。在机器人任务中,VideoWorld 有效学习了多种控制操作并实现了跨环境的泛化,在 CALVIN 和 RLBench 中的性能接近 oracle 模型。本研究为从视觉数据中获取知识开辟了新途径,所有代码、数据和模型均已开源以供进一步研究。
引用
@article{arxiv.2501.09781,
title = {VideoWorld: Exploring Knowledge Learning from Unlabeled Videos},
author = {Zhongwei Ren and Yunchao Wei and Xun Guo and Yao Zhao and Bingyi Kang and Jiashi Feng and Xiaojie Jin},
journal= {arXiv preprint arXiv:2501.09781},
year = {2025}
}
备注
Code and models are released at: https://maverickren.github.io/VideoWorld.github.io/