研究人脸识别训练数据中个体纳入对个体人脸辨识的影响
计算机与社会
2020-01-14 v2 计算机视觉与模式识别
摘要
现代人脸识别系统利用包含数十万特定个体人脸图像的数据集来训练深度卷积神经网络,以学习一个将任意个体人脸映射为其身份向量表示的嵌入空间。人脸识别系统在人脸验证(1:1)和人脸辨识(1:N)任务中的性能,与嵌入空间区分不同身份的能力直接相关。近来,诸如 MS-Celeb-1M 和 MegaFace 等大规模人脸识别训练数据集的来源与隐私影响受到公众显著审视,因为许多人不愿其人脸被用于训练可促成大规模监控的双用途技术。然而,个体被纳入训练数据对其衍生系统识别该个体能力的影响此前尚未被研究。在这项工作中,我们在一个包含超过一百万干扰图像的大规模人脸辨识实验中审计了最先进的开放源码人脸识别系统 ArcFace。我们发现,对于出现在模型训练数据中的个体,其 Rank-1 人脸辨识准确率为 79.71%,而未出现的个体准确率为 75.73%。这一微小的准确率差异表明,使用深度学习的识别系统对其训练所用的个体表现更好,考虑到所有主要的开放源码人脸识别训练数据集在收集时均未获得个体的知情同意,这具有严重的隐私影响。
引用
@article{arxiv.2001.03071,
title = {Investigating the Impact of Inclusion in Face Recognition Training Data on Individual Face Identification},
author = {Chris Dulhanty and Alexander Wong},
journal= {arXiv preprint arXiv:2001.03071},
year = {2020}
}
备注
2020 AAAI/ACM Conference on AI, Ethics, and Society (AIES 20) | V2 updated latex character rendering issues