它很 COMPASlicated:RAI 数据集与算法公平性基准之间混乱的关系
计算机与社会
2022-05-02 v3
摘要
风险评估工具(risk assessment instrument, RAI)数据集,尤其是 ProPublica 的 COMPAS 数据集,由于在与先前工作所用数据集上比较算法的基准化实践,常被用于算法公平性论文中。在许多情况下,该数据被用作基准以展示良好性能,却未考虑刑事司法(CJ)流程的复杂性。然而,我们表明审前 RAI 数据集可能包含大量测量偏差与错误,并且由于裁量权与部署中的差异,应用于 RAI 数据集的算法公平性在断言真实世界结果方面存在局限。这些原因使该数据集在具有 ground truth 与真实世界影响假设下的基准测试中不甚合适。此外,简单复现先前数据实验的常规做法可能隐式继承或强化规范性立场,而未明确审视负载价值的假设。若无跨学科领域如何从事 CJ 研究以及 RAI 如何在上游与下游运作的语境,算法公平性实践便与在 CJ 语境下作出有意义贡献错位,并将受益于对公平性、正义与平等相关的规范性考量与价值的透明参与。这些因素引发了对像 CJ 系统这类内在社会技术系统的基准能否以有益且合乎伦理的方式存在的问题。
引用
@article{arxiv.2106.05498,
title = {It's COMPASlicated: The Messy Relationship between RAI Datasets and Algorithmic Fairness Benchmarks},
author = {Michelle Bao and Angela Zhou and Samantha Zottola and Brian Brubach and Sarah Desmarais and Aaron Horowitz and Kristian Lum and Suresh Venkatasubramanian},
journal= {arXiv preprint arXiv:2106.05498},
year = {2022}
}
备注
NeurIPS 2021 Datasets and Benchmarks