中文

EmojiDiff:面向人像生成的高身份保持 facial expression 控制

计算机视觉与模式识别 2025-12-09 v3

摘要

本文旨在在保持高保真身份的同时实现面部表情的细粒度控制。这一目标面临挑战,原因在于表情与身份之间的相互干扰:(i)细粒度表情控制信号不可避免地引入与身份相关的外观语义(例如面部轮廓、比例),从而影响生成人像的身份;(ii) 即使是粗糙的表情控制也会导致面部变化,进而损害身份,因为它们都作用于面部。这些限制未被以往的生成方法所解决,这些方法主要依赖粗糙的控制信号或 two-stage inference 集成人像动画。我们引入EmojiDiff,是首个实现面部表情(RGB级)和高保真身份同时控制的人像生成解决方案。为解决上述挑战,EmojiDiff采用解耦训练和 fine-tuning 两阶段方案。 For decoupled training,我们创新了 ID-irrelevant Data Iteration(IDI),通过划分和优化保持表情和改变身份的过程,从而确保稳定且高质量的数据生成。使用该数据训练模型,我们有效地将细粒度表情特征从表情模板中解耦出来,与其他冗余信息(例如身份、皮肤)分离。随后,我们提出ID-enhanced Contrast Alignment(ICA)进行进一步fine-tuning。ICA通过快速重建和联合监督身份与表情信息,实现了带有表情控制图像与不带表情图像身份表示的对齐。实验结果表明,我们的方法显著优于其他方法,实现了精确的表情控制并高度保持身份,并在 various diffusion models中表现出良好的泛化性。

关键词

引用

@article{arxiv.2412.01254,
  title  = {EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation},
  author = {Liangwei Jiang and Ruida Li and Zhifeng Zhang and Shuo Fang and Chenguang Ma},
  journal= {arXiv preprint arXiv:2412.01254},
  year   = {2025}
}

备注

accepted by WACV 2026