中文

VideoSwap: 基于交互式语义点对应的定制化视频主体替换

计算机视觉与模式识别 2023-12-06 v2

摘要

当前基于扩散模型的视频编辑主要侧重于结构保持编辑,通过利用各种密集对应来确保时间一致性与运动对齐。然而,当目标编辑涉及形状变化时,这些方法往往无效。为了开展涉及形状变化的视频编辑,本工作探索了定制化视频主体替换,旨在将源视频中的主体替换为具有不同身份且可能具有不同形状的目标主体。与以往依赖密集对应的方法不同,我们引入了 VideoSwap 框架,该框架利用语义点对应,其灵感来自于我们的观察:仅需少量语义点即可对齐主体的运动轨迹并修改其形状。我们还引入了各种用户点交互(例如移除点和拖拽点)以处理各种语义点对应。大量实验表明,在多种真实世界视频中取得了 SOTA 的视频主体替换结果。

关键词

引用

@article{arxiv.2312.02087,
  title  = {VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point Correspondence},
  author = {Yuchao Gu and Yipin Zhou and Bichen Wu and Licheng Yu and Jia-Wei Liu and Rui Zhao and Jay Zhangjie Wu and David Junhao Zhang and Mike Zheng Shou and Kevin Tang},
  journal= {arXiv preprint arXiv:2312.02087},
  year   = {2023}
}

备注

Project page at https://videoswap.github.io