中文

OSV:一步到位的高质量图像到视频生成

计算机视觉与模式识别 2025-04-04 v2

摘要

视频扩散模型在生成高质量视频方面显示出巨大潜力,使其成为越来越受欢迎的焦点。然而,其固有的迭代性质导致了巨大的计算和时间成本。尽管已经通过减少推理步骤(通过一致性蒸馏等技术)和 GAN 训练来加速视频扩散,但这些方法通常在性能或训练稳定性方面存在不足。在这项工作中,我们引入了一个两阶段训练框架,该框架有效地将一致性蒸馏与 GAN 训练相结合以解决这些挑战。此外,我们提出了一种新颖的视频判别器设计,它消除了对视频潜变量进行解码的需要,并提高了最终性能。我们的模型能够仅用一步生成高质量视频,并具有执行多步细化以进一步提升性能的灵活性。我们在 OpenWebVid-1M 基准上的定量评估表明,我们的模型显著优于现有方法。值得注意的是,我们的 1 步性能(FVD 171.15)超过了基于一致性蒸馏的方法 AnimateLCM 的 8 步性能(FVD 184.79),并接近先进的 Stable Video Diffusion 的 25 步性能(FVD 156.94)。

关键词

引用

@article{arxiv.2409.11367,
  title  = {OSV: One Step is Enough for High-Quality Image to Video Generation},
  author = {Xiaofeng Mao and Zhengkai Jiang and Fu-Yun Wang and Jiangning Zhang and Hao Chen and Mingmin Chi and Yabiao Wang and Wenhan Luo},
  journal= {arXiv preprint arXiv:2409.11367},
  year   = {2025}
}