FaceCrafter:基于解�散控的身份条件扩散模型,实现对面部姿态、表情和情感的精确控制
计算机视觉与模式识别
2025-08-26 v2
摘要
人类面部图像编码了丰富的信息领域,包含稳定的身份相关特征以及姿态、表情和情感等可变属性。尽管近期进展使面向身份条件的人脸合成实现了高质量,但对非身份属性的精确控制仍具有挑战,解编离身份与这些可变因素的困难更为突出。为解决这些限制,我们提出一种新型身份条件扩散模型,引入两个轻量级控制模块,用于独立操控面部姿态、表情和情感,而不损害身份保持。这些模块嵌入在基础扩散模型的交叉注意力层中,实现对属性的精确控制且参数开销最小。此外,我们针对性的训练策略利用身份特征与每个非身份控制特征之间的交叉注意力,鼓励身份特征与控制信号正交,从而增强可控性和多样性。定量和定性评估以及感知用户研究均表明,我们的方法在姿态、表情和情感控制方面超越现有方法,同时在仅基于身份条件下提高生成多样性。
引用
@article{arxiv.2505.15313,
title = {FaceCrafter: Identity-Conditional Diffusion with Disentangled Control over Facial Pose, Expression, and Emotion},
author = {Kazuaki Mishima and Antoni Bigata Casademunt and Stavros Petridis and Maja Pantic and Kenji Suzuki},
journal= {arXiv preprint arXiv:2505.15313},
year = {2025}
}
备注
9 pages(excluding references), 3 figures, 5 tables