AVID:基于扩散模型的任意长度视频修复
计算机视觉与模式识别
2024-04-02 v3
摘要
扩散模型的最新进展已成功实现了文本引导的图像修复。虽然将这种编辑能力扩展到视频领域看似直接,但关于文本引导视频修复的工作仍然较少。给定一段视频、其初始帧的掩码区域以及一个编辑提示,这要求模型在遵循编辑引导的同时对每一帧进行填充,并保持掩码外区域不变。文本引导的视频修复存在三个主要挑战:() 编辑视频的时序一致性,() 在不同结构保真度水平下支持不同的修复类型,以及 () 处理可变视频长度。为了应对这些挑战,我们引入了基于扩散模型的任意长度视频修复,简称 AVID。其核心在于,我们的模型配备了有效的运动模块和可调的结构引导,用于固定长度的视频修复。在此基础上,我们提出了一种新颖的 Temporal MultiDiffusion 采样管线以及中间帧注意力引导机制,促进了任意期望时长视频的生成。我们的综合实验表明,该模型能够在不同的视频时长范围内,以高质量稳健地处理各种修复类型。更多可视化结果已在 https://zhang-zx.github.io/AVID/ 公开发布。
引用
@article{arxiv.2312.03816,
title = {AVID: Any-Length Video Inpainting with Diffusion Model},
author = {Zhixing Zhang and Bichen Wu and Xiaoyan Wang and Yaqiao Luo and Luxin Zhang and Yinan Zhao and Peter Vajda and Dimitris Metaxas and Licheng Yu},
journal= {arXiv preprint arXiv:2312.03816},
year = {2024}
}
备注
Project website: https://zhang-zx.github.io/AVID/