中文

AVID:基于扩散模型的任意长度视频修复

计算机视觉与模式识别 2024-04-02 v3

摘要

扩散模型的最新进展已成功实现了文本引导的图像修复。虽然将这种编辑能力扩展到视频领域看似直接,但关于文本引导视频修复的工作仍然较少。给定一段视频、其初始帧的掩码区域以及一个编辑提示,这要求模型在遵循编辑引导的同时对每一帧进行填充,并保持掩码外区域不变。文本引导的视频修复存在三个主要挑战:(ii) 编辑视频的时序一致性,(iiii) 在不同结构保真度水平下支持不同的修复类型,以及 (iiiiii) 处理可变视频长度。为了应对这些挑战,我们引入了基于扩散模型的任意长度视频修复,简称 AVID。其核心在于,我们的模型配备了有效的运动模块和可调的结构引导,用于固定长度的视频修复。在此基础上,我们提出了一种新颖的 Temporal MultiDiffusion 采样管线以及中间帧注意力引导机制,促进了任意期望时长视频的生成。我们的综合实验表明,该模型能够在不同的视频时长范围内,以高质量稳健地处理各种修复类型。更多可视化结果已在 https://zhang-zx.github.io/AVID/ 公开发布。

关键词

引用

@article{arxiv.2312.03816,
  title  = {AVID: Any-Length Video Inpainting with Diffusion Model},
  author = {Zhixing Zhang and Bichen Wu and Xiaoyan Wang and Yaqiao Luo and Luxin Zhang and Yinan Zhao and Peter Vajda and Dimitris Metaxas and Licheng Yu},
  journal= {arXiv preprint arXiv:2312.03816},
  year   = {2024}
}

备注

Project website: https://zhang-zx.github.io/AVID/