中文

视频扩散模型是强大的视频修复工具

计算机视觉与模式识别 2024-12-17 v3

摘要

基于光流在像素或特征层面进行传播的视频修复方法近期引起了广泛关注。然而,它存在光流预测不准确和噪声随时间传播等局限性。这些问题导致视频中出现非均匀噪声和时间一致性问题,当移除区域较大且涉及大量运动时尤为突出。为解决这些问题,我们提出了一种新颖的首帧填充视频扩散修复模型(FFF-VDI)。我们设计的 FFF-VDI 借鉴了预训练的图像到视频扩散模型的能力,该模型可以将首帧图像转换为高度自然的视频。为将其应用于视频修复任务,我们将未来帧的噪声潜变量信息传播以填充首帧噪声潜编码中的掩码区域。接下来,我们对预训练的图像到视频扩散模型进行微调以生成修复后的视频。所提出的方法解决了依赖光流质量的现有方法的局限性,能够生成更加自然和时间一致的视频。该方法是首个有效将图像到视频扩散模型集成到视频修复任务中的方法。通过各种对比实验,我们证明了所提出的模型能够稳健地处理多种修复类型并具有高质量。

关键词

引用

@article{arxiv.2408.11402,
  title  = {Video Diffusion Models are Strong Video Inpainter},
  author = {Minhyeok Lee and Suhwan Cho and Chajin Shin and Jungho Lee and Sunghun Yang and Sangyoun Lee},
  journal= {arXiv preprint arXiv:2408.11402},
  year   = {2024}
}

备注

Accepted to AAAI 2025