中文

MTV-Inpaint:多任务长视频修复

计算机视觉与模式识别 2025-03-17 v1

摘要

视频修复涉及修改视频内的局部区域,并确保空间与时间的一致性。现有大多数方法主要关注场景补全(即填充缺失区域),缺乏以可控方式向场景中插入新对象的能力。幸运的是,文本到视频(Text-to-Video, T2V)扩散模型的最新进展为文本引导的视频修复铺平了道路。然而,直接将 T2V 模型适配于修复在统一补全与插入任务方面仍然受限,缺乏输入可控性,且难以处理长视频,从而限制了其适用性与灵活性。为了应对这些挑战,我们提出了 MTV-Inpaint,这是一个统一的多任务视频修复框架,能够处理传统的场景补全和新颖的对象插入任务。为了统一这些不同的任务,我们在 T2V 扩散 U-Net 中设计了一种双分支空间注意力机制,实现了场景补全与对象插入在单一框架内的无缝集成。除文本引导外,MTV-Inpaint 还通过我们提出的图像到视频(Image-to-Video, I2V)修复模式集成各种图像修复模型,从而支持多模态控制。此外,我们提出了一种结合关键帧修复与中间帧传播的两阶段流水线,使 MTV-Inpaint 能够有效处理包含数百帧的长视频。大量实验表明,MTV-Inpaint 在场景补全和对象插入任务中均实现了 SOTA 性能。此外,它在多模态修复、对象编辑、移除、图像对象涂抹以及处理长视频能力等衍生应用中展现了多功能性。项目页面:https://mtv-inpaint.github.io/。

关键词

引用

@article{arxiv.2503.11412,
  title  = {MTV-Inpaint: Multi-Task Long Video Inpainting},
  author = {Shiyuan Yang and Zheng Gu and Liang Hou and Xin Tao and Pengfei Wan and Xiaodong Chen and Jing Liao},
  journal= {arXiv preprint arXiv:2503.11412},
  year   = {2025}
}