LAVIE:基于级联潜在扩散模型的高质量视频生成
计算机视觉与模式识别
2023-09-28 v2
摘要
本工作旨在利用预训练的文本到图像(T2I)模型作为基础,学习一个高质量的文本到视频(T2V)生成模型。同时 a) 完成视觉真实且时间连贯的视频合成,并 b) 保留预训练 T2I 模型强大的创造性生成特性,是一项极受期待却极具挑战的任务。为此,我们提出 LaVie,一个基于级联视频潜在扩散模型构建的集成视频生成框架,包含基础 T2V 模型、时间插值模型和视频超分辨率模型。我们的关键见解有两方面:1) 我们揭示,引入简单的时序自注意力并结合旋转位置编码,足以捕捉视频数据固有的时间相关性。2) 此外,我们验证图像-视频联合微调过程在产生高质量和创造性结果方面起着关键作用。为提升 LaVie 的性能,我们贡献了一个全面且多样的视频数据集 Vimeo25M,包含 2500 万条优先考虑质量、多样性和美学吸引力的文本-视频对。大量实验表明,LaVie 在定量和定性上均达到了最先进的(SOTA)性能。此外,我们展示了预训练 LaVie 模型在各种长视频生成和个性化视频合成应用中的通用性。
引用
@article{arxiv.2309.15103,
title = {LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models},
author = {Yaohui Wang and Xinyuan Chen and Xin Ma and Shangchen Zhou and Ziqi Huang and Yi Wang and Ceyuan Yang and Yinan He and Jiashuo Yu and Peiqing Yang and Yuwei Guo and Tianxing Wu and Chenyang Si and Yuming Jiang and Cunjian Chen and Chen Change Loy and Bo Dai and Dahua Lin and Yu Qiao and Ziwei Liu},
journal= {arXiv preprint arXiv:2309.15103},
year = {2023}
}
备注
Project webpage: https://vchitect.github.io/LaVie-project/