性别分类算法偏差审计与缓解:一种数据中心方法
计算机视觉与模式识别
2026-01-23 v2 人工智能
摘要
性别分类系统往往继承并放大其训练数据中的人口统计不平衡。我们首先审计了五个广泛使用的性别分类数据集,发现所有数据集都存在显著的交叉表示不足。为了衡量这些缺陷的下游影响,我们在两个最平衡的数据集(UTKFace和FairFace)上训练相同的MobileNetV2分类器。我们的公平性评估显示,即便是这些模型也表现出显著偏差,误将女性面孔分类为男性的概率高于男性面孔,并且放大了现有的种族偏差。为了抵消这些数据引起的偏差,我们构建BalancedFace,一个由FairFace和UTKFace图像混合而成的新公开数据集, supplemented with images from other collections to fill missing demographic gaps。它通过仅使用真实、未经编辑的图像来实现跨189种年龄、种族和性别交叉组合的子群共享平等。当在BalancedFace上训练标准分类器时,可将种族子群中最大的真阳性率差距降低超过50%,将平均Disparate Impact得分距离理想值1.0接近63%,同时整体准确率几乎不变。这些结果凸显了数据中心干预的深远价值,提供了公开可用的公平性性别分类研究资源。
引用
@article{arxiv.2510.17873,
title = {Auditing and Mitigating Bias in Gender Classification Algorithms: A Data-Centric Approach},
author = {Tadesse K Bahiru and Natnael Tilahun Sinshaw and Teshager Hailemariam Moges and Dheeraj Kumar Singh},
journal= {arXiv preprint arXiv:2510.17873},
year = {2026}
}
备注
The manuscript contains a substantive error identified after submission