中文

揭开合成人脸的面纱:合成数据集如何暴露真实身份

计算机视觉与模式识别 2024-11-01 v1

摘要

合成数据生成在各类计算机视觉应用中日益普及。现有最先进的人脸识别模型均使用大规模人脸数据集进行训练,这些数据集从互联网爬取,引发了隐私和伦理方面的担忧。为解决这些问题,一些研究提出生成合成人脸数据集来训练人脸识别模型。然而,这些方法依赖于在真实人脸图像上训练的生成模型。在本工作中,我们设计了一种简单而有效的成员推理攻击,以系统研究现有的合成人脸识别数据集是否泄露了用于训练生成器模型的真实数据的任何信息。我们对6个最先进的合成人脸识别数据集进行了广泛研究,结果表明,在所有这些合成数据集中,原始真实数据集的多个样本均被泄露。据我们所知,本文是首篇揭示生成器模型训练数据泄露到所生成合成人脸识别数据集中的工作。我们的研究揭示了合成人脸识别数据集中的隐私陷阱,并为未来研究如何生成负责任的合成人脸数据集铺平了道路。

关键词

引用

@article{arxiv.2410.24015,
  title  = {Unveiling Synthetic Faces: How Synthetic Datasets Can Expose Real Identities},
  author = {Hatef Otroshi Shahreza and Sébastien Marcel},
  journal= {arXiv preprint arXiv:2410.24015},
  year   = {2024}
}

备注

Accepted in NeurIPS 2024 Workshop on New Frontiers in Adversarial Machine Learning