InVi:基于现成扩散模型的对象视频插入
计算机视觉与模式识别
2024-07-16 v1
摘要
我们提出 InVi 方法,用于在视频中插入或替换物体(称为图像修复),其依托于现成的文本到图像潜在扩散模型。InVi 旨在实现对物体的受控操控,并将其无缝融合到背景视频中,不同于现有视频编辑方法专注于全面重新风格化或整体场景改变。为实现此目标,我们解决了两个关键挑战。首先,为实现高质量控制和融合,我们采用两步流程,涉及图像修复与匹配。该流程首先通过基于 ControlNet 的图像修复扩散模型将物体插入单个帧中,然后在以修复后帧为锚点生成后续帧,以最小化背景与物体之间的领域差距。其次,为确保时间一致性,我们将扩散模型的自注意力层替换为扩展注意力层。该锚点帧特征作为这些层的键和值,从而增强跨帧的一致性。我们的做法无需针对视频进行特定微调,呈现出一种高效且具有可适应性的解决方案。实验结果表明,InVi 能够实现真实感的物体插入,并在帧之间实现一致的融合与一致性,超越现有方法。
关键词
引用
@article{arxiv.2407.10958,
title = {InVi: Object Insertion In Videos Using Off-the-Shelf Diffusion Models},
author = {Nirat Saini and Navaneeth Bodla and Ashish Shrivastava and Avinash Ravichandran and Xiao Zhang and Abhinav Shrivastava and Bharat Singh},
journal= {arXiv preprint arXiv:2407.10958},
year = {2024}
}