懒惰的数据实践损害公平性研究
机器学习
2024-06-21 v2 计算机与社会
应用统计
机器学习
摘要
数据实践塑造了机器学习公平性(公平ML)的研究和实践。关键数据研究通过突出缺点和提出改进建议,为领域的负责任发展提供了重要的反思和批评。在这项工作中,我们对公平ML数据集进行了全面分析,展示了不反思的常见实践如何阻碍算法公平性发现的范围和可靠性。我们系统地研究了表格数据集中编码的保护信息及其在142篇出版物的280个实验中的使用情况。我们的分析确定了三个主要关注领域:(1)数据和评估中某些保护属性的代表性不足;(2)数据预处理过程中对少数群体的广泛排除;(3)不透明的数据处理威胁着公平性研究的泛化。通过对著名数据集的使用进行示例性分析,我们展示了不反思的数据决策如何不成比例地影响少数群体、公平性指标和由此产生的模型比较。此外,我们确定了加剧这些挑战的补充因素,如公开可用数据的局限性、隐私考虑和普遍缺乏意识。为了解决这些问题,我们提出了一套以透明和负责任包容为中心的公平性研究中数据使用的建议。这项研究强调了在公平ML中批判性重新评估数据实践的必要性,并提供了改进数据集来源和使用的方向。
引用
@article{arxiv.2404.17293,
title = {Lazy Data Practices Harm Fairness Research},
author = {Jan Simson and Alessandro Fabris and Christoph Kern},
journal= {arXiv preprint arXiv:2404.17293},
year = {2024}
}