中文

SwapAnyone:将任意人物替换至任意视频的一致且逼真的视频合成

计算机视觉与模式识别 2025-03-13 v1

摘要

视频人物替换旨在将现有视频中的身体替换为来自任意来源的新身体,近年来受到了更多关注。现有方法将视频人物替换视为多个任务的组合而非独立任务,并且通常依赖各种模型顺序实现视频人物替换。然而,这些方法无法对视频人物替换实现端到端优化,从而导致诸如图像帧间亮度变化、遮挡关系混乱以及身体与背景之间明显分离等问题。在这项工作中,我们将视频人物替换定义为一项独立任务,并提出了三个关键一致性:身份一致性、运动一致性和环境一致性。我们引入了一个名为 SwapAnyone 的端到端模型,将视频人物替换视为具有参考保真度和运动控制的视频修复任务。为了提高保持环境和谐的能力,特别是结果视频中的亮度和谐,我们引入了一种新颖的 EnvHarmony 策略来渐进式训练我们的模型。此外,我们提供了一个名为 HumanAction-32K 的数据集,其中包含有关人类动作的各种视频。大量实验表明,我们的方法在开源方法中实现了 State-Of-The-Art (SOTA) 性能,同时在多个维度上接近或超越了闭源模型。所有代码、模型权重和 HumanAction-32K 数据集将在 https://github.com/PKU-YuanGroup/SwapAnyone 开源。

关键词

引用

@article{arxiv.2503.09154,
  title  = {SwapAnyone: Consistent and Realistic Video Synthesis for Swapping Any Person into Any Video},
  author = {Chengshu Zhao and Yunyang Ge and Xinhua Cheng and Bin Zhu and Yatian Pang and Bin Lin and Fan Yang and Feng Gao and Li Yuan},
  journal= {arXiv preprint arXiv:2503.09154},
  year   = {2025}
}