MagicVideo:基于隐扩散模型的高效视频生成
计算机视觉与模式识别
2023-05-12 v2
摘要
我们提出一种基于隐扩散模型的高效文本到视频生成框架,称为MagicVideo。MagicVideo可生成与给定文本描述一致的平滑视频片段。得益于新颖高效的3D U-Net设计以及在低维空间中对视频分布建模,MagicVideo能在单块GPU卡上合成空间分辨率256x256的视频片段,其计算量(以FLOPs计)约为Video Diffusion Models(VDM)的1/64。具体而言,不同于现有直接在RGB空间训练视频模型的工作,我们使用预训练VAE将视频片段映射到低维隐空间,并通过扩散模型学习视频隐码的分布。此外,我们引入两种新设计以将图像任务上训练的U-Net去噪器适配到视频数据:用于图像到视频分布调整的逐帧轻量适配器,以及用于捕捉跨帧时间依赖的有向时间注意力模块。因此,我们可以利用来自文本到图像模型的卷积算子信息权重来加速视频训练。为改善生成视频中的像素抖动,我们还提出了一种新颖的VideoVAE自编码器以更好地进行RGB重建。我们进行了大量实验,表明MagicVideo能生成具有真实或虚构内容的高质量视频片段。更多示例参见\url{https://magicvideo.github.io/#}。
引用
@article{arxiv.2211.11018,
title = {MagicVideo: Efficient Video Generation With Latent Diffusion Models},
author = {Daquan Zhou and Weimin Wang and Hanshu Yan and Weiwei Lv and Yizhe Zhu and Jiashi Feng},
journal= {arXiv preprint arXiv:2211.11018},
year = {2023}
}