中文

当公平性指标相左时:评估机器学习中人口统计公平性评估的可靠性

机器学习 2026-05-21 v2 人工智能 计算机视觉与模式识别

摘要

机器学习系统中的公平性评估已成为高风险应用中的核心关切,这些应用包括生物特征识别、医疗决策和自动化风险评估。现有方法通常依赖少量公平性指标来评估模型在不同群体划分下的行为,并隐含地假设这些指标能提供一致且可靠的结论。然而,不同的公平性指标捕捉模型性能的不同统计特性,因此在应用于同一系统时可能产生相互冲突的评估。在本工作中,我们通过对机器学习模型中的人口统计偏差进行系统的多指标分析,来研究公平性评估的一致性。以人脸识别作为受控实验环境,我们在一系列常用公平性指标(包括错误率差异和基于性能的度量)下,评估模型在多种群体划分下的性能。我们的结果表明,公平性评估可能因指标选择的不同而显著变化,从而导致关于模型偏差的矛盾结论。为量化这一现象,我们引入了公平性分歧指数(FDI),该度量旨在捕捉不同公平性指标间的不一致程度。我们进一步表明,在不同阈值和模型配置下,分歧程度依然很高。这些发现凸显了当前公平性评估实践中的一个关键局限,并表明单一指标报告不足以进行可靠的偏差评估。

关键词

引用

@article{arxiv.2604.15038,
  title  = {When Fairness Metrics Disagree: Evaluating the Reliability of Demographic Fairness Assessment in Machine Learning},
  author = {Khalid Adnan Alsayed},
  journal= {arXiv preprint arXiv:2604.15038},
  year   = {2026}
}

备注

15 pages, 4 figues, 5 tables