中文

MVOC: 基于扩散模型的无训练多视频物体组合方法

计算机视觉与模式识别 2024-06-25 v1

摘要

视频组合是视频编辑的核心任务。虽然基于扩散模型的图像组合取得了极高的成功,但将成果直接扩展到视频物体组合任务并不直接。视频物体组合不仅要呈现相应的相互作用,还要确保组合后视频中物体保持运动和身份一致性,这是合成物理和谐视频的必要条件。为此,我们提出一种基于扩散模型的多视频物体组合 (MVOC) 方法。具体而言,我们首先对每个视频物体执行 DDIM 逆变换以获得相应的噪声特征。随后,我们采用图像编辑方法对每个物体进行组合与编辑,以获得合成视频的第一帧。最后,我们使用图像到视频生成模型,结合特征和注意力注入,在视频物体依赖模块中完成视频合成,该模块是一种无训练的条件引导操作,用于视频生成,并实现了各种物体之间特征和注意力图之间的协调。最终生成的模型不仅约束生成视频中物体与原始物体运动和身份一致,还在物体之间引入相互作用。大量实验表明,所提方法优于现有的领先方法。项目页面: https://sobeymil.github.io/mvoc.com。

关键词

引用

@article{arxiv.2406.15829,
  title  = {MVOC: a training-free multiple video object composition method with diffusion models},
  author = {Wei Wang and Yaosen Chen and Yuegen Liu and Qi Yuan and Shubin Yang and Yanru Zhang},
  journal= {arXiv preprint arXiv:2406.15829},
  year   = {2024}
}