中文

基于标准空间调制的高保真且一致的视频人脸换脸方法——CanonSwap

计算机视觉与模式识别 2025-07-04 v1

摘要

视频人脸换脸旨在解决两个主要挑战:有效地将源身份传递给目标视频,以及准确保留目标人脸的动态属性,如头部姿态、面部表情、唇同步等。现有方法主要关注实现高质量的身份传递,但往往在保持目标人脸动态属性方面不足,导致结果不一致。我们认为这一问题源于面部外观与运动在视频中的天然耦合。为此,我们提出 CanonSwap,一种新的视频人脸换脸框架,通过标准空间调制(canonical space modulation)来解耦运动信息与外观信息。具体而言,CanonSwap 首先消除与运动相关的信息,使身份修改在统一的标准空间内完成。随后,将换脸特征重新集成到原始视频空间中,以确保保留目标人脸的动态属性。为进一步实现精准的身份传递、最小化人工物并增强真实感,我们设计了部分身份调制模块(Partial Identity Modulation),以空间掩码方式自适应地整合源身份特征,以限制修改仅限于面部区域。此外,我们引入若干细粒度同步指标,以全面评估视频人脸换脸方法的性能。大量实验表明,我们的方法在视觉质量、时间一致性和身份保留方面显著优于现有方法。我们的项目页面已公开于 https://luoxyhappy.github.io/CanonSwap/。

关键词

引用

@article{arxiv.2507.02691,
  title  = {CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation},
  author = {Xiangyang Luo and Ye Zhu and Yunfei Liu and Lijian Lin and Cong Wan and Zijian Cai and Shao-Lun Huang and Yu Li},
  journal= {arXiv preprint arXiv:2507.02691},
  year   = {2025}
}

备注

ICCV Accepted