中文

用于高保真长视频生成的潜变量视频扩散模型

计算机视觉与模式识别 2023-03-21 v2 人工智能

摘要

AI 生成内容近来备受关注,但照片级真实视频合成仍具挑战性。尽管该领域已有许多基于 GAN 与自回归模型的尝试,生成视频的视觉质量与长度仍远不能令人满意。扩散模型近期展现出卓越结果,但需要大量计算资源。为此,我们利用低维三维潜空间引入轻量视频扩散模型,在有限计算预算下显著优于先前的像素空间视频扩散模型。此外,我们提出潜空间中的分层扩散,从而可生成超过一千帧的更长视频。为进一步克服长视频生成的性能退化问题,我们提出条件潜扰动与无条件引导,有效缓解视频长度扩展过程中累积的误差。在不同类别的小规模领域数据集上的大量实验表明,我们的框架比先前强基线生成更真实且更长的视频。我们额外提供了面向大规模文本到视频生成的扩展以证明我们工作的优越性。我们的代码与模型将公开可用。

关键词

引用

@article{arxiv.2211.13221,
  title  = {Latent Video Diffusion Models for High-Fidelity Long Video Generation},
  author = {Yingqing He and Tianyu Yang and Yong Zhang and Ying Shan and Qifeng Chen},
  journal= {arXiv preprint arXiv:2211.13221},
  year   = {2023}
}

备注

Project Page: https://yingqinghe.github.io/LVDM/ Github: https://github.com/YingqingHe/LVDM