中文

VideoControlNet:一种基于扩散模型与 ControlNet 的运动引导视频到视频翻译框架

计算机视觉与模式识别 2023-08-04 v2

摘要

近来,诸如 StableDiffusion 之类的扩散模型已取得令人瞩目的图像生成结果。然而,此类扩散模型的生成过程不可控,难以生成具有连续且一致内容的视频。在本工作中,我们利用带 ControlNet 的扩散模型,提出了一种称为 VideoControlNet 的新型运动引导视频到视频翻译框架,基于给定提示词和输入视频的条件生成各类视频。受使用运动信息降低时间冗余的视频编解码器启发,我们的框架利用运动信息来防止冗余区域的重新生成以保持内容一致性。具体而言,我们使用带 ControlNet 的扩散模型生成第一帧(即 I 帧)。然后基于前一 I/P 帧,利用我们新提出的运动引导 P 帧生成(MgPG)方法生成其他关键帧(即 P 帧),其中 P 帧基于运动信息生成,遮挡区域使用扩散模型进行修复。最后,其余帧(即 B 帧)由我们提出的运动引导 B 帧插值(MgBI)模块生成。我们的实验表明,所提 VideoControlNet 继承了预训练大型扩散模型的生成能力,并利用运动信息将图像扩散模型扩展为视频扩散模型。更多结果见我们的项目页面。

关键词

引用

@article{arxiv.2307.14073,
  title  = {VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet},
  author = {Zhihao Hu and Dong Xu},
  journal= {arXiv preprint arXiv:2307.14073},
  year   = {2023}
}