基于条件扩散模型的语义一致视频填充
计算机视觉与模式识别
2024-10-10 v2 机器学习
摘要
当前最先进的视频填充方法通常依赖光流或注意力机制,通过在帧之间传递视觉信息来填充被遮盖区域。尽管此类方法在标准基准上取得了显著进展,但在需要合成其他帧中不存在的新内容的任务上仍存在困难。本文将视频填充重新定义为条件生成建模问题,提出一种基于条件视频扩散模型的解决方案。我们引入填充特定的采样方案,以捕获上下文中的关键长程依赖关系,并设计一种新方法用于对不完整帧中的已知像素进行条件化。我们展示了使用生成方法的优势,表明本方法能够生成多样化、高质量的填充结果,并能够合成与提供上下文在空间、时间和语义上一致的新内容。
引用
@article{arxiv.2405.00251,
title = {Semantically Consistent Video Inpainting with Conditional Diffusion Models},
author = {Dylan Green and William Harvey and Saeid Naderiparizi and Matthew Niedoba and Yunpeng Liu and Xiaoxuan Liang and Jonathan Lavington and Ke Zhang and Vasileios Lioutas and Setareh Dabiri and Adam Scibior and Berend Zwartsenberg and Frank Wood},
journal= {arXiv preprint arXiv:2405.00251},
year = {2024}
}