CA-IDD:用于身份一致换脸的交叉注意力引导身份条件扩散
计算机视觉与模式识别
2026-04-28 v1
摘要
换脸旨在利用源人脸的身份生成目标人脸的真实面部图像,同时保留姿态、表情和背景。然而,现有方法,特别是基于 GAN 的方法,由于有限的可控性和模式崩溃,往往难以平衡身份保持与视觉真实感。在本文中,我们提出了 CA-IDD(交叉注意力引导身份条件扩散,Cross-Attention Guided Identity-Conditional Diffusion),这是首个基于扩散的换脸方法,通过多尺度交叉注意力整合了包含注视、身份和面部解析的多模态引导。预计算的身份嵌入通过分层注意力层被纳入去噪过程,从而实现准确且一致的身份迁移。为了提高语义连贯性和视觉质量,我们使用了专家引导的监督,并配合面部解析和注视一致性模块。与基于 GAN 或隐式融合的方法不同,我们的扩散框架提供了稳定的训练、鲁棒的泛化能力以及空间自适应的身份对齐,允许在姿态和表情变化下进行细粒度的区域控制。CA-IDD 达到了 11.73 的 FID,超越了 FaceShifter 和 MegaFS 等既有基线。定性结果同样揭示了在多样化姿态下身份保持的改善,确立了 CA-IDD 作为未来基于扩散的面部编辑的坚实基础。
引用
@article{arxiv.2604.24493,
title = {CA-IDD: Cross-Attention Guided Identity-Conditional Diffusion for Identity-Consistent Face Swapping},
author = {Md Shohel Rana and Tanoy Debnath},
journal= {arXiv preprint arXiv:2604.24493},
year = {2026}
}