中文

超越真实人脸:合成数据集可以在不损害隐私的情况下实现可靠的识别性能

计算机视觉与模式识别 2025-10-21 v1

摘要

人脸识别系统的部署造成了一个伦理困境:要实现高精度,需要未经同意收集的大规模真实人脸数据集,这导致了数据集撤回和根据GDPR等法规可能承担的法律责任。虽然合成面部数据提供了一种有前景的隐私保护替代方案,但该领域缺乏其可行性的全面实证证据。本研究通过广泛评估合成人脸识别数据集来解决这一关键空白。我们提出了一项系统性的文献综述,识别出25个合成人脸识别数据集(2018-2025年),并结合了严格的实验验证。我们的方法考察了隐私保护合成数据的七个关键要求:身份泄漏预防、类内变异性、身份可分性、数据集规模、道德数据来源、偏差缓解和基准可靠性。通过涉及超过1000万个合成样本的实验,并辅以五个标准基准上报告的结果比较,我们提供了关于合成数据替代真实数据集能力的首次全面实证评估。性能最佳的合成数据集(VariFace、VIGFace)分别达到了95.67%和94.91%的识别准确率,超过了包括CASIA-WebFace(94.70%)在内的已建立的真实数据集。虽然这些图像保持私有,但公开可用的替代方案Vec2Face(93.52%)和CemiFace(93.22%)紧随其后。我们的研究结果表明,它们在保持身份可分性的同时确保了适当的类内变异性。人口统计偏差分析表明,即使合成数据继承了有限的偏差,它也通过生成参数为偏差缓解提供了前所未有的控制。这些结果确立了合成面部数据作为人脸识别研究中科学可行且伦理上必要的替代方案。

关键词

引用

@article{arxiv.2510.17372,
  title  = {Beyond Real Faces: Synthetic Datasets Can Achieve Reliable Recognition Performance without Privacy Compromise},
  author = {Paweł Borsukiewicz and Fadi Boutros and Iyiola E. Olatunji and Charles Beumier and Wendkûuni C. Ouedraogo and Jacques Klein and Tegawendé F. Bissyandé},
  journal= {arXiv preprint arXiv:2510.17372},
  year   = {2025}
}