为什么聚合准确率不足以评估执法面部识别系统中的公平性
计算机视觉与模式识别
2026-05-21 v2 人工智能
机器学习
摘要
面部识别系统越来越多地部署在执法和安全场景中,算法决策可能带来重大社会后果。尽管报告的准确率很高,但越来越多的证据表明,此类系统在不同人口群体之间往往表现出不均衡的性能,导致不成比例的错误率和潜在损害。本文认为,聚合准确率不足以评估高风险环境中面部识别系统的公平性和可靠性。通过对子群体层面错误分布的分析,包括错误正例率(FPR)和错误负例率(FNR),本文展示了聚合性能指标如何掩盖不同人口群体之间的关键差异。实证观察表明,具有相似整体准确率的系统可能表现出截然不同的公平性特征,子群体错误率差异显著,尽管只有一个聚合指标。本文进一步考察了以准确率为中心的评估实践在执法应用中带来的运营风险,其中误分类可能导致错误怀疑或漏检。本文强调了公平性感知评估方法和模型无关的审计策略的重要性,这些策略支持对已部署系统的实际评估。研究结果强调需要超越准确率作为主要指标,并采用更全面的评估框架以实现负责任的AI部署。
引用
@article{arxiv.2603.28675,
title = {Why Aggregate Accuracy is Inadequate for Evaluating Fairness in Law Enforcement Facial Recognition Systems},
author = {Khalid Adnan Alsayed},
journal= {arXiv preprint arXiv:2603.28675},
year = {2026}
}
备注
9 pages, 2 tables, 1 figure. Position paper with empirical subgroup analysis highlighting limitations of aggregate accuracy in fairness evaluation