中文

SmoothVideo:基于扩散模型噪声约束的一次性视频调优平滑视频合成

计算机视觉与模式识别 2024-02-07 v2

摘要

近期基于预训练文本到图像模型(如 Stable Diffusion)在特定视频上微调网络的一次性视频调优方法,因灵活性而在社区中广受欢迎。然而,这些方法生成的视频常受不连贯与不一致问题困扰。为应对这些局限,本文引入了一种简洁而有效的跨视频帧噪声约束。该约束旨在调节噪声在其时间邻域上的预测,从而产生平滑的隐变量。它可在训练阶段简单地作为损失项加入。通过将此损失应用于现有的一次性视频调优方法,我们显著提升了生成视频的整体一致性与平滑度。此外,我们认为当前的视频评估指标未能充分捕捉平滑性。为此,我们引入了一种考虑细节特征及其时间动态的新指标。实验结果验证了我们的方法在各种一次性视频调优基线上生成更平滑视频的有效性。源代码与视频演示可在 \href{https://github.com/SPengLiang/SmoothVideo}{https://github.com/SPengLiang/SmoothVideo} 获取。

关键词

引用

@article{arxiv.2311.17536,
  title  = {SmoothVideo: Smooth Video Synthesis with Noise Constraints on Diffusion Models for One-shot Video Tuning},
  author = {Liang Peng and Haoran Cheng and Zheng Yang and Ruisi Zhao and Linxuan Xia and Chaotian Song and Qinglin Lu and Boxi Wu and Wei Liu},
  journal= {arXiv preprint arXiv:2311.17536},
  year   = {2024}
}