合成数据集在人脸表情识别中的适用性研究
计算机视觉与模式识别
2026-05-19 v1
摘要
人脸表情识别面临两个核心挑战:第一个是公共数据集中的类别不平衡,这会偏斜学习过程并削弱泛化能力;第二个涉及隐私和数据收集限制,这限制了人脸图像的共享,并限制了创建大规模平衡数据集的可能性。为此,我们检验了三种互补策略,用于构建标准七类离散人脸表情类的隐私保护FER数据集。我们的策略包括:(i)在置信阈值方案下,使用教师模型对大规模未标记人脸集合进行伪标签化;(ii)使用以人口统计属性为条件的扩散模型进行提示驱动的合成;(iii)基于任务的GAN式表情编辑,在保持身份和真实感的同时修改人脸表情。用于训练和评估,我们采用了广泛接受的数据集,包括AffectNet、RAF-DB和FER2013。我们利用合成数据集DigiFace、DCFace和EmoNet-Face BIG作为未标记来源进行伪标签化。此外,我们利用FFHQ数据集作为生成合成的数据来源。主要实验使用经典CNN骨干网络IR50进行,同时我们也探索了更复杂的架构POSTERv1,以评估其可行性和鲁棒性。通过跨数据集评估,我们分析了每种策略在精选数据集中的权衡。研究结果表明,合成数据可以有效替代或与真实数据集结合,以缓解不平衡和隐私限制。代码和生成的数据集:https://www.github.com/AliAZ98/SyntFER
引用
@article{arxiv.2605.17483,
title = {On Applicability of Synthetic Datasets for Facial Expression Recognition},
author = {Ali Azmoudeh and Erdi Sarıtaş and Ömer Yıldırım and Hazım Kemal Ekenel},
journal= {arXiv preprint arXiv:2605.17483},
year = {2026}
}