中文

训练数据中种族分布对人脸识别偏差的影响:进一步探究

计算机视觉与模式识别 2023-02-14 v1 计算机与社会 机器学习

摘要

人脸识别算法在现实世界中使用时可能非常有用,但当其偏向于某些人口群体时也可能带来危险。因此,理解这些算法如何训练以及哪些因素影响其准确性与公平性,对于构建更好的算法至关重要。在本研究中,我们揭示了训练数据中人脸种族分布对人脸识别模型性能的影响。我们进行了16项不同的实验,改变训练数据中人脸的种族分布。我们使用准确性指标、聚类指标、UMAP投影、人脸质量与决策阈值对这些训练好的模型进行分析。我们表明,训练数据集中种族的均匀分布本身并不能保证无偏差的人脸识别算法,并且诸如人脸图像质量等因素起着关键作用。我们还研究了聚类指标与偏差之间的相关性,以理解聚类是否是偏差的良好指示器。最后,我们引入一种称为种族梯度的指标,用以研究面部特征在种族间与种族内的相关性,以及它们如何影响人脸识别模型的学习能力。通过本研究,我们试图对人脸识别训练的一个关键要素——数据,带来更多的理解。更好地理解训练数据对人脸识别算法偏差的影响,将有助于创建更好的数据集,进而构建更好的人脸识别系统。

关键词

引用

@article{arxiv.2211.14498,
  title  = {The Impact of Racial Distribution in Training Data on Face Recognition Bias: A Closer Look},
  author = {Manideep Kolla and Aravinth Savadamuthu},
  journal= {arXiv preprint arXiv:2211.14498},
  year   = {2023}
}

备注

10 pages, 5 figures, Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision Workshops (WACVW), 2023