风险评分、标签偏差与除厨房水槽外的一切
计算机与社会
2023-05-23 v1 应用统计
摘要
在设计风险评估算法时,许多学者提倡“厨房水槽”式方法,其推理是更多信息可产生更准确的预测。然而,我们表明,当算法被训练用以预测真实结果的代理变量时(通常情况如此),这一理由往往不成立。在存在此种“标签偏差”时,若某一特征与代理变量的相关性及其与真实结果的相关性在给定其他模型特征条件下符号相反,则应排除该特征。当某一特征与真实结果弱相关,且该特征与真实结果均为其余特征的直接原因时,该准则常被满足。例如,由于警力部署模式,犯罪行为与地理位置可能弱相关,且二者均为个人犯罪记录的直接原因,这表明在以逮捕作为行为代理变量训练犯罪风险评估时,应排除地理位置。
引用
@article{arxiv.2305.12638,
title = {Risk Scores, Label Bias, and Everything but the Kitchen Sink},
author = {Michael Zanger-Tishler and Julian Nyarko and Sharad Goel},
journal= {arXiv preprint arXiv:2305.12638},
year = {2023}
}
备注
19 pages, 4 figures