中文

DiffSwap++: 基于 3D 隐空间控制的身份保持人脸换脸

计算机视觉与模式识别 2025-11-11 v1

摘要

扩散模型方法近期在人脸换脸任务中取得了显著成果,相较于传统的 GAN 方法,展现了更好的视觉质量。然而,即便是最先进的模型在细粒度细节和身份保持方面仍常常存在问题,尤其是在挑战性的姿态和表情下。现有方法的关键局限在于未能有效利用 3D 人脸结构,而这在 disentangle(解耦)身份信息与姿态、表情方面至关重要。本文提出了 DiffSwap++,一种新颖的基于扩散模型的人脸换脸管线,训练过程中引入 3D 人脸隐特征。通过基于 3D 信息的表示引导生成过程,我们的方法增强了几何一致性,改善了人脸身份与外观属性的解耦。我们进一步设计了一种扩散架构,使去噪过程能够同时依赖身份嵌入和人脸关键点,从而实现高保真且身份保持的人脸换脸。在 CelebA、FFHQ 和 CelebV-Text 数据集上进行大量实验,表明 DiffSwap++ 在保持源身份的同时,能够更好地维持目标姿态和表情,优于先前的方法。我们还引入了生物识别风格的评估方法,并进行了用户研究,以进一步验证该方法的真实性和有效性。代码将公开于 https://github.com/WestonBond/DiffSwapPP

关键词

引用

@article{arxiv.2511.05575,
  title  = {DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping},
  author = {Weston Bondurant and Arkaprava Sinha and Hieu Le and Srijan Das and Stephanie Schuckers},
  journal= {arXiv preprint arXiv:2511.05575},
  year   = {2025}
}