中文

基于扩散模型的照片级真实感视频生成

计算机视觉与模式识别 2023-12-12 v1 人工智能 机器学习

摘要

我们提出了 W.A.L.T,这是一种基于 Transformer 的方法,通过扩散建模实现照片级真实感视频生成。我们的方法有两个关键设计决策。首先,我们使用一个因果编码器在统一的潜在空间中联合压缩图像和视频,从而实现跨模态的训练和生成。其次,为了内存和训练效率,我们使用了一种专为联合空间和时空生成建模而设计的窗口注意力架构。综合这些设计决策,使我们能够在无需使用无分类器引导的情况下,在既定的视频(UCF-101 和 Kinetics-600)和图像(ImageNet)生成基准上达到最先进的性能。最后,我们还训练了一个由三个模型组成的级联模型,用于文本到视频生成任务,该级联模型由一个基础潜在视频扩散模型和两个视频超分辨率扩散模型组成,以每秒 8 帧的速度生成分辨率为 512×896512 \times 896 的视频。

关键词

引用

@article{arxiv.2312.06662,
  title  = {Photorealistic Video Generation with Diffusion Models},
  author = {Agrim Gupta and Lijun Yu and Kihyuk Sohn and Xiuye Gu and Meera Hahn and Li Fei-Fei and Irfan Essa and Lu Jiang and José Lezama},
  journal= {arXiv preprint arXiv:2312.06662},
  year   = {2023}
}

备注

Project website https://walt-video-diffusion.github.io/