用于人脸识别中合成与真实数据评估的大规模标注数据集
计算机视觉与模式识别
2024-04-24 v1
摘要
人脸识别应用随着数据集规模、深度学习模型复杂度和计算能力的增长而发展。然而,当深度学习模型进化得更加能力强大、计算能力持续增加时,可用的数据集却在被撤回并从公共访问中移除。隐私和伦理问题是这些领域中的相关话题。通过生成式人工智能,研究人员致力于开发可用于训练人脸识别系统的完全合成数据集。尽管如此,最近的进展还不足以达到与在真实数据上训练的最先进模型相当的性能。为了研究在真实和合成数据集上训练的模型性能之间的漂移,我们利用一个大规模属性分类器(MAC)为四个数据集创建标注:两个真实数据集和两个合成数据集。从这些标注中,我们对所有四个数据集中每个属性的分布进行了研究。此外,我们进一步检查了真实和合成数据集在属性集上的差异。当通过Kullback-Leibler散度进行比较时,我们发现真实样本和合成样本之间存在差异。有趣的是,我们验证了虽然真实样本足以解释合成分布,但反过来则远非如此。
引用
@article{arxiv.2404.15234,
title = {Massively Annotated Datasets for Assessment of Synthetic and Real Data in Face Recognition},
author = {Pedro C. Neto and Rafael M. Mamede and Carolina Albuquerque and Tiago Gonçalves and Ana F. Sequeira},
journal= {arXiv preprint arXiv:2404.15234},
year = {2024}
}
备注
Accepted at FG 2024