中文

WorldDreamer:通过预测掩码 Token 迈向通用世界模型的视频生成

计算机视觉与模式识别 2024-01-19 v1

摘要

世界模型在理解和预测世界动态方面发挥着至关重要的作用,这对于视频生成是必不可少的。然而,现有的世界模型局限于游戏或驾驶等特定场景,限制了它们捕捉一般世界动态环境的复杂性的能力。因此,我们引入了 WorldDreamer,这是一个具有开创性的世界模型,旨在促进对一般世界物理和运动的全面理解,从而显著增强视频生成的能力。受大语言模型成功的启发,WorldDreamer 将世界建模构建为一个无监督的视觉序列建模挑战。这是通过将视觉输入映射到离散 token 并预测被掩蔽的 token 来实现的。在此过程中,我们引入了多模态提示以促进世界模型内的交互。我们的实验表明,WorldDreamer 在跨不同场景(包括自然场景和驾驶环境)生成视频方面表现出色。WorldDreamer 展现了在执行文本到视频转换、图像到视频合成以及视频编辑等任务时的多功能性。这些结果突显了 WorldDreamer 在捕捉多样化一般世界环境中动态要素的有效性。

关键词

引用

@article{arxiv.2401.09985,
  title  = {WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens},
  author = {Xiaofeng Wang and Zheng Zhu and Guan Huang and Boyuan Wang and Xinze Chen and Jiwen Lu},
  journal= {arXiv preprint arXiv:2401.09985},
  year   = {2024}
}

备注

project page: https://world-dreamer.github.io/