公平性感知机器学习数据集综述
机器学习
2022-03-08 v3
摘要
随着决策日益依赖于机器学习(ML)与(大)数据,数据驱动的人工智能(AI)系统中的公平性问题正受到学术界与工业界越来越多的关注。人们已提出大量公平性感知机器学习解决方案,这些方案涉及在数据、学习算法和/或模型输出中引入与公平性相关的干预。然而,提出新方法的一个重要环节是在代表真实且多样场景的基准数据集上对其进行实证评估。因此,本文综述了用于公平性感知机器学习的真实世界数据集。我们聚焦于表格数据,因其是公平性感知机器学习中最常见的数据表示形式。我们首先利用贝叶斯网络识别不同属性之间的关系,特别是关于受保护属性与类属性的关系,以此作为分析的起点。为更深入地理解数据集中的偏差,我们通过探索性分析研究了这些有趣的关系。
引用
@article{arxiv.2110.00530,
title = {A survey on datasets for fairness-aware machine learning},
author = {Tai Le Quy and Arjun Roy and Vasileios Iosifidis and Wenbin Zhang and Eirini Ntoutsi},
journal= {arXiv preprint arXiv:2110.00530},
year = {2022}
}
备注
56 pages, 36 figures, 20 tables