深入探究人脸辨识中的数据集不平衡与偏差
计算机视觉与模式识别
2022-03-17 v1 机器学习
摘要
随着自动化人脸识别(FR)系统的部署日益广泛,这些系统中的偏差已不仅是学术问题,更成为公众关切的事项。媒体常将不平衡描绘为偏差的主要来源,即 FR 模型在非白人或女性图像上表现更差,是因为这些人口群体在训练数据中代表性不足。近期的学术研究对这一关系给出了更为细致的描述。然而,以往关于 FR 中数据不平衡的研究仅关注人脸验证场景,而人脸辨识场景虽已部署于执法等敏感应用中,却基本被忽视。这是一个令人遗憾的遗漏,因为“不平衡”在辨识中更为复杂;不平衡不仅可能出现在训练数据中,也可能出现在测试数据中,且还可能影响各人口群体所占身份的比例或各身份所拥有图像的数量。在本工作中,我们通过彻底探究人脸辨识中各类可能的不平衡所产生的影响来弥补这一研究空白,并讨论在该场景下可能影响偏差的其他因素。
引用
@article{arxiv.2203.08235,
title = {A Deep Dive into Dataset Imbalance and Bias in Face Identification},
author = {Valeriia Cherepanova and Steven Reich and Samuel Dooley and Hossein Souri and Micah Goldblum and Tom Goldstein},
journal= {arXiv preprint arXiv:2203.08235},
year = {2022}
}