改进生成式对抗网络在面部表情合成中的泛化能力
计算机视觉与模式识别
2026-03-18 v1 图形学
机器学习
多媒体
摘要
面部表情合成旨在生成逼真的面部表情,同时保持身份特征。现有的条件生成式对抗网络(GAN)在图像到图像转换方面取得了优异的效果,但在测试图像与训练数据集不同时,性能常会下降。我们提出了回归生成对抗网络(RegGAN),一种通过学习中间表示来提升训练分布之外泛化能力的模型。RegGAN由两个组件构成:一个具有局部感受野的回归层,通过岭回归损失最小化重建误差来学习表情细节,以及一个在对抗训练下优化生成图像真实感的细化网络。我们在CFEE数据集上训练RegGAN,并在CFEE以及挑战性的分布外图像(包括明星照片、肖像、雕塑和头像渲染图)上评估其泛化性能。对于评估,我们采用四个常用指标:用于表情质量的表情分类得分(ECS)、用于身份保持的面部相似度得分(FSS)、用于感知真实性的QualiCLIP,以及用于综合评估表情质量与真实性的Fr\'echet Inception Distance(FID)。RegGAN在ECS、FID和QualiCLIP方面超越了六个最先进模型,在FSS上排名第二。人类评估显示,RegGAN在表情质量上超越最佳对手模型25%,在身份保持上提升26%,在真实性方面提升30%。
引用
@article{arxiv.2603.15648,
title = {Improving Generative Adversarial Network Generalization for Facial Expression Synthesis},
author = {Arbish Akram and Nazar Khan and Arif Mahmood},
journal= {arXiv preprint arXiv:2603.15648},
year = {2026}
}