VariFace: 用于人脸识别的公平且多样化的合成数据集生成
计算机视觉与模式识别
2025-04-18 v2 机器学习
摘要
使用大规模网络爬取数据集训练人脸识别模型引发了严重的隐私和偏见问题。合成方法缓解了这些担忧,并提供了可扩展且可控的人脸生成,以实现公平且准确的人脸识别。然而,现有的合成数据集呈现有限的类内和类间多样性,且无法匹配使用真实数据集获得的人脸识别性能。在此,我们提出了VariFace,一个基于扩散的两阶段流水线,用于创建公平且多样化的合成人脸数据集以训练人脸识别模型。具体而言,我们引入了三种方法:人脸识别一致性(Face Recognition Consistency)以细化人口统计标签,人脸Vendi分数引导(Face Vendi Score Guidance)以提升类间多样性,以及散度分数条件化(Divergence Score Conditioning)以平衡身份保持与类内多样性之间的权衡。在相同数据集规模约束下,VariFace显著优于之前的合成数据集(0.9200 → 0.9405),并达到了与使用真实数据训练的人脸识别模型相当的性能(Real Gap = -0.0065)。在无约束设置下,VariFace不仅在所有数据集规模上始终优于之前的合成方法,而且首次在六个评估数据集上超越了真实数据集(CASIA-WebFace)。这在LFW、CFP-FP、CPLFW、AgeDB和CALFW数据集上实现了0.9567的平均人脸验证准确率(Real Gap = +0.0097)的新最先进性能,在RFW数据集上实现了0.9366(Real Gap = +0.0380)。
引用
@article{arxiv.2412.06235,
title = {VariFace: Fair and Diverse Synthetic Dataset Generation for Face Recognition},
author = {Michael Yeung and Toya Teramoto and Songtao Wu and Tatsuo Fujiwara and Kenji Suzuki and Tamaki Kojima},
journal= {arXiv preprint arXiv:2412.06235},
year = {2025}
}