中文

视频生成基础技术的演进

计算机视觉与模式识别 2026-04-09 v1

摘要

人工智能生成内容(AIGC)的快速发展彻底改变了视频生成领域,使从 OpenAI 的 Sora、Google 的 Veo3、字节跳动的 Seedance 等专有技术到万(Wan)、HunyuanVideo 等强大开源方案,能够合成具有时序一致性和语义丰富性的视频。这些技术进展为构建“世界模型”提供了可能,这些模型能够模拟真实世界的动态,广泛应用于娱乐、教育和虚拟现实领域。然而,现有的视频生成综述往往聚焦于狭窄的技术领域,如生成对抗网络(GAN)和扩散模型,或针对特定任务(如视频编辑),缺乏对该领域演进的全面视角,尤其是关于自回归(AR)模型和多模态信息集成。为填补此 gap,本综述首先系统回顾了视频生成技术的发展历程,从早期的GAN发展到主导性的扩散模型,再到新兴的基于AR模型和多模态技术。我们深入分析了基础原理、关键进展及其比较优势与局限。随后,本文探讨了多模态视频生成的新趋势,强调整合多样化数据类型以增强情境感知。最后,本综述通过连接历史发展与当代创新,为视频生成及其应用(包括虚拟/增强现实、个性化教育、自动驾驶仿真、数字娱乐和高级世界模型)提供了前瞻性见解。欲了解更多详情,请参阅项目 https://github.com/sjtuplayer/Awesome-Video-Foundations。

关键词

引用

@article{arxiv.2604.06339,
  title  = {Evolution of Video Generative Foundations},
  author = {Teng Hu and Jiangning Zhang and Hongrui Huang and Ran Yi and Zihan Su and Jieyu Weng and Zhucun Xue and Lizhuang Ma and Ming-Hsuan Yang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2604.06339},
  year   = {2026}
}