中文

基于遮蔽运动建模的图像引导视频编辑

计算机视觉与模式识别 2025-01-09 v1

摘要

最近的扩散模型进展显著促进了文本引导的视频编辑。然而,关于图像引导的视频编辑研究相对稀少,这种方法使用户能够仅通过指示初始帧中的目标对象并提供一个 RGB 图像作为参考来编辑视频,而无需依赖文本提示。在本文中,我们提出一种新的 Image-guided Video Editing扩散模型,称为 IVEDiff 以实现图像引导视频编辑。IVEDiff 建立在图像编辑模型之上,配备可学习的运动模块以保持编辑后视频的时序一致性。灵感来自自监督学习概念,我们引入一种遮蔽运动建模微调策略,使运动模块能够捕捉帧间运动动态,同时保持基础图像编辑模型用于帧内语义相关性建模的能力。此外,提出了一种光流引导的运动参考网络,以确保编辑后视频帧之间信息的准确传递,减轻无效信息的误导性影响。我们还构建了一个基准数据集以促进进一步的研究。综合实验表明,我们的方法能够生成在各种编辑对象上都表现稳健且高质量的时序平滑编辑视频。

关键词

引用

@article{arxiv.2501.04325,
  title  = {Edit as You See: Image-guided Video Editing via Masked Motion Modeling},
  author = {Zhi-Lin Huang and Yixuan Liu and Chujun Qin and Zhongdao Wang and Dong Zhou and Dong Li and Emad Barsoum},
  journal= {arXiv preprint arXiv:2501.04325},
  year   = {2025}
}