中文

VideoLCM: 视频潜在一致性模型

计算机视觉与模式识别 2023-12-15 v1 人工智能

摘要

一致性模型在高效图像生成中展示了强大的能力,并允许在少量采样步骤内进行合成,从而减轻了扩散模型中的高计算成本。然而,在更具挑战性和资源消耗的视频生成中,一致性模型的研究仍然较少。在本报告中,我们提出了VideoLCM框架来填补这一空白,该框架利用图像生成中的一致性模型概念,以最少的步骤高效合成视频,同时保持高质量。VideoLCM建立在现有的潜在视频扩散模型之上,并结合了一致性蒸馏技术来训练潜在一致性模型。实验结果揭示了我们的VideoLCM在计算效率、保真度和时间一致性方面的有效性。值得注意的是,VideoLCM仅需四个采样步骤即可实现高保真和流畅的视频合成,展示了实时合成的潜力。我们希望VideoLCM能够为后续研究提供一个简单而有效的基线。源代码和模型将公开提供。

关键词

引用

@article{arxiv.2312.09109,
  title  = {VideoLCM: Video Latent Consistency Model},
  author = {Xiang Wang and Shiwei Zhang and Han Zhang and Yu Liu and Yingya Zhang and Changxin Gao and Nong Sang},
  journal= {arXiv preprint arXiv:2312.09109},
  year   = {2023}
}