中文

DiffSynth:用于真实视频合成的潜空间迭代内去闪烁方法

计算机视觉与模式识别 2023-08-11 v3 多媒体

摘要

近年来,扩散模型已成为图像合成中最强大的方法。然而,将这些模型直接应用于视频合成会带来挑战,因为它常导致明显的闪烁内容。尽管最近提出的零样本方法能在一定程度上缓解闪烁,我们仍难以生成连贯的视频。在本文中,我们提出 DiffSynth,一种旨在将图像合成流水线转换为视频合成流水线的新方法。DiffSynth 由两个关键组件组成:潜空间迭代内去闪烁框架和视频去闪烁算法。潜空间迭代内去闪烁框架将视频去闪烁应用于扩散模型的潜空间,有效防止中间步骤中的闪烁累积。此外,我们提出一种称为块混合算法的视频去闪烁算法,该算法重新映射不同帧中的对象并将其混合以增强视频一致性。DiffSynth 的一个显著优势是它普遍适用于各种视频合成任务,包括文本引导视频风格化、时尚视频合成、图像引导视频风格化、视频修复和 3D 渲染。在文本引导视频风格化任务中,我们使得无需挑选即可合成高质量视频。实验结果证明了 DiffSynth 的有效性。所有视频可在我们的项目页面查看。源代码也将发布。

关键词

引用

@article{arxiv.2308.03463,
  title  = {DiffSynth: Latent In-Iteration Deflickering for Realistic Video Synthesis},
  author = {Zhongjie Duan and Lizhou You and Chengyu Wang and Cen Chen and Ziheng Wu and Weining Qian and Jun Huang},
  journal= {arXiv preprint arXiv:2308.03463},
  year   = {2023}
}

备注

9 pages, 6 figures