中文

VipDiff:基于训练-free 去噪扩散模型实现一致性和多样性视频填充

计算机视觉与模式识别 2025-01-22 v1

摘要

最近的视频填充方法通过利用光流引导像素从参考帧传递(要么在图像空间,要么在特征空间),取得了令人鼓舞的改进。然而,当遮罩区域过大且无法为中心找到像素对应关系时,这些方法会在遮罩中心产生严重的伪影。最近,扩散模型在生成多样且高质量图像方面表现出色,已被大量工作用于图像填充。然而,这些方法无法直接应用于视频以产生时域一致的填充结果。本文提出一种训练-free 框架,命名为 VipDiff,用于对反向扩散过程进行条件化,以在不要求任何训练数据或微调预训练扩散模型的情况下,产生时域一致的填充结果。VipDiff 采用光流作为引导,从参考帧提取有效像素作为约束,用于优化随机采样的高斯噪声,并使用生成结果进行进一步的像素传递和条件生成。VipDiff 还允许在不同采样噪声下生成多样化的视频填充结果。实验表明,VipDiff 在空间-时间一致性和保真度方面显著优于最先进的视频填充方法。

关键词

引用

@article{arxiv.2501.12267,
  title  = {VipDiff: Towards Coherent and Diverse Video Inpainting via Training-free Denoising Diffusion Models},
  author = {Chaohao Xie and Kai Han and Kwan-Yee K. Wong},
  journal= {arXiv preprint arXiv:2501.12267},
  year   = {2025}
}

备注

10 pages, 5 Figures (Accepted at WACV 2025)