中文

算法公平性数据集:迄今综述

计算机与社会 2022-09-27 v4

摘要

数据驱动的算法在多个领域中被研究以支撑关键决策,直接影响人们的福祉。因此,日益壮大的研究者群体一直在调查现有算法的公平性并提出新算法,增进对历史上弱势群体的自动化决策风险与机遇的理解。公平机器学习(fair Machine Learning)的进展依赖于数据,而数据只有在被充分记录时才可被恰当使用。遗憾的是,算法公平性社区深受集体性数据文档债务之苦,其成因在于特定资源信息缺失(不透明)与可用信息分散(稀疏)。在本工作中,我们旨在通过调查算法公平性研究中使用的两百余个数据集,并为每一个生成标准化且可检索的文档,来应对数据文档债务。此外,我们严格识别出三个最流行的公平性数据集,即 Adult、COMPAS 和 German Credit,并为它们编制了深入文档。这一统一文档工作支撑了多重贡献。首先,我们总结了 Adult、COMPAS 和 German Credit 的优缺点,补充并统一了近期学术成果,对其作为通用公平性基准的适用性提出质疑。其次,我们记录并总结了数百个可用替代数据集,标注其领域与所支持的公平性任务,以及公平性研究者感兴趣的其他属性。最后,我们从五个重要数据策展主题——匿名化、知情同意、包容性、敏感属性与透明度——出发分析这些数据集。我们讨论了针对不同主题的方法与关注程度,使其具体化,并提炼为一套用于策展新资源的最佳实践。

关键词

引用

@article{arxiv.2202.01711,
  title  = {Algorithmic Fairness Datasets: the Story so Far},
  author = {Alessandro Fabris and Stefano Messina and Gianmaria Silvello and Gian Antonio Susto},
  journal= {arXiv preprint arXiv:2202.01711},
  year   = {2022}
}

备注

Published in Data Mining and Knowledge Discovery https://doi.org/10.1007/s10618-022-00854-z