中文

重访 ProPublica 的 COMPAS 数据

综合经济学 2019-07-10 v3 计算机与社会 机器学习 经济学 应用统计

摘要

我审视了 ProPublica 于 2016 年收集的 COMPAS 再犯风险评分与犯罪史数据,该数据引发了‘算法公平’这一新兴领域的激烈辩论与研究。ProPublica 的 COMPAS 数据正被越来越多研究用于检验算法公平的各种定义。本文仔细考察 ProPublica 实际构建的数据集,特别是为研究被告初始 COMPAS 筛查日期后两年内再犯可能性而建立的子数据集。我采用一种新颖而简单的方法,通过分析被告在 COMPAS 筛查日期上的分布来可视化这些数据。我发现 ProPublica 在创建这些数据集时犯了一个重要的数据处理错误,未能对此类数据集中的再犯者实施两年样本截断规则(而其对非再犯者实施了该规则)。当我为再犯者实施简单的两年 COMPAS 筛查日期截断规则时,估计在两年一般再犯数据集中 ProPublica 保留的再犯者比应保留的多出逾 40%。数据集构建中的这一根本问题对某些统计量的影响大于其他。它显然对再犯率有实质影响,人为地抬高了它。对于 ProPublica 创建的两年一般再犯数据集,两年再犯率为 45.1%,而采用我所实施的简单 COMPAS 筛查日期截断修正后,该值为 36.2%。因此,ProPublica 数据集中的两年再犯率被抬高了逾 24%。这也影响了阳性与阴性预测值。另一方面,该数据处理错误对其他一些关键统计量的影响甚微,这些量较不易受再犯者相对占比变化的影响,如假阳性率、假阴性率与总体准确率。

关键词

引用

@article{arxiv.1906.04711,
  title  = {ProPublica's COMPAS Data Revisited},
  author = {Matias Barenstein},
  journal= {arXiv preprint arXiv:1906.04711},
  year   = {2019}
}

备注

28 pages, 13 figures (v3); fixed figure and footnote formatting; edited writing, organization, references, and appendix, results unchanged