中文

DiffuEraser:基于稳定扩散模型的视频填洞

计算机视觉与模式识别 2025-01-20 v1

摘要

最近的视频填洞算法将基于流的像素传递与基于转换器的生成集成,以利用光流恢复纹理和物体信息(来自相邻帧),同时通过视觉转换器完成被遮盖区域。然而,这些方法常在处理大面积遮罩时遇到模糊和时序不一致的问题,凸显了需要具备更强生成能力的模型。最近,扩散模型因其卓越性能在图像和视频生成中成为热门技术。本文提出 DiffuEraser,一种基于稳定扩散的视频填洞模型,旨在以更丰富的细节和更连贯的结构填充被遮盖区域。我们整合先验信息提供初始化和弱条件,有助于减轻噪声伪影并抑制幻觉。此外,为提高长序列推理中的时序一致性,我们扩大了先验模型和 DiffuEraser 的时域感受野,并进一步通过利用视频扩散模型的时序平滑特性来增强一致性。实验结果表明,我们的方法在内容完整性和时序一致性方面均优于最先进的技术,同时保持可接受的效率。

关键词

引用

@article{arxiv.2501.10018,
  title  = {DiffuEraser: A Diffusion Model for Video Inpainting},
  author = {Xiaowen Li and Haolan Xue and Peiran Ren and Liefeng Bo},
  journal= {arXiv preprint arXiv:2501.10018},
  year   = {2025}
}

备注

11pages, 13figures