面向一致且可控的人脸编辑图像合成
计算机视觉与模式识别
2025-11-27 v3
摘要
人脸编辑方法对于虚拟化身、数字人合成和身份保持等任务至关重要,传统上基于 GAN 技术构建,而最近的焦点已转向基于扩散的模型,因为它们在图像重建方面取得了成功。然而,扩散模型在控制特定属性和保持其他不变属性(尤其是身份特征)的一致性方面仍然面临挑战。为了解决这些问题并实现更便捷的人脸图像编辑,我们提出了一种新颖的方法,利用 Stable-Diffusion (SD) 模型和粗略的 3D 人脸模型来控制肖像照片的光照、面部表情和头部姿态。我们观察到,这项任务本质上涉及目标背景、身份和待编辑面部属性的组合。我们努力充分解耦这些因素的控制,以实现人脸编辑的一致性。具体来说,我们的方法名为 RigFace,包含:1) 一个空间属性编码器,提供精确且解耦的背景、姿态、表情和光照条件;2) 一种高一致性 FaceFusion 方法,将身份特征从身份编码器迁移到预训练 SD 模型的去噪 UNet 中;3) 一个属性装配器,将这些条件注入到去噪 UNet 中。与现有的人脸编辑模型相比,我们的模型在身份保持和照片真实感方面都达到了可比甚至更优的性能。
引用
@article{arxiv.2502.02465,
title = {Towards Consistent and Controllable Image Synthesis for Face Editing},
author = {Mengting Wei and Tuomas Varanka and Yante Li and Xingxun Jiang and Huai-Qian Khor and Guoying Zhao},
journal= {arXiv preprint arXiv:2502.02465},
year = {2025}
}