中文

保持你自己的关联性:一种用于视频扩散模型的噪声先验

计算机视觉与模式识别 2024-03-27 v3 图形学 机器学习

摘要

尽管使用扩散模型生成高质量图像取得了巨大进展,但合成既照片级真实又时间连贯的动画帧序列仍处于起步阶段。虽然可用于图像生成的现成十亿规模数据集已经存在,但收集同等规模的视频数据仍具挑战性。此外,训练视频扩散模型的计算开销也远高于图像对应模型。在本工作中,我们探索用视频数据微调预训练图像扩散模型,作为视频合成任务的一种实用方案。我们发现,在视频扩散中将图像噪声先验朴素地扩展为视频噪声先验会导致次优性能。我们精心设计的视频噪声先验带来了显著更优的性能。大量实验验证表明,我们的模型 Preserve Your Own Correlation (PYoCo) 在 UCF-101 和 MSR-VTT 基准上获得了 SOTA 零样本文本到视频结果。它还在小规模 UCF-101 基准上以小 10×10\times 的模型、且计算量远少于先前方法,取得了 SOTA 视频生成质量。

关键词

引用

@article{arxiv.2305.10474,
  title  = {Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models},
  author = {Songwei Ge and Seungjun Nah and Guilin Liu and Tyler Poon and Andrew Tao and Bryan Catanzaro and David Jacobs and Jia-Bin Huang and Ming-Yu Liu and Yogesh Balaji},
  journal= {arXiv preprint arXiv:2305.10474},
  year   = {2024}
}

备注

ICCV 2023. Project webpage: https://research.nvidia.com/labs/dir/pyoco