解决人口统计预测中的离散化偏差
计算机与社会
2024-05-28 v1 机器学习
摘要
种族和其他人口统计推断对于许多应用是必要的,特别是在审计差异和政治竞选中的外展定位。典型的方法是构建连续预测——例如基于姓名和地理位置——然后通过选择最可能的类别(argmax)来离散化预测。我们研究了这种做法如何产生离散化偏差。特别是,我们表明,正如一家著名的商业选民档案供应商用于推断种族/民族所使用的argmax标记,导致非裔美国选民被严重低估,例如在北卡罗来纳州低估了28.2个百分点。这种偏差可能对使用此类标签的下游任务产生重大影响。然后,我们引入了一种联合优化方法——以及一种可处理的数据驱动阈值化启发式方法——可以消除这种偏差,且个体级准确率损失可忽略不计。最后,我们从理论上分析了离散化偏差,表明校准的连续模型不足以消除它,而像我们这样的方法是必要的。总的来说,我们警告研究人员和从业者不要在不考虑下游后果的情况下离散化连续人口统计预测。
引用
@article{arxiv.2405.16762,
title = {Addressing Discretization-Induced Bias in Demographic Prediction},
author = {Evan Dong and Aaron Schein and Yixin Wang and Nikhil Garg},
journal= {arXiv preprint arXiv:2405.16762},
year = {2024}
}
备注
A version of this paper was accepted to the 2024 ACM Conference on Fairness, Accountability, and Transparency