针对具有多个受保护属性的表格数据集的偏差测量与缓解
机器学习
2024-11-05 v3 人工智能
摘要
受欧盟《人工智能法案》当前勘误表第(67)条陈述的启发,我们提出并展示了针对表格数据集中歧视的测量和缓解策略。我们特别关注包含多个受保护属性(如国籍、年龄和性别)的数据集。这使得测量和缓解偏差更具挑战性,因为许多现有方法是为单一受保护属性设计的。本文有双重贡献:首先,引入了新的歧视测量方法。这些测量方法在我们的框架中与现有方法一起分类,指导研究人员和从业者选择合适的测量方法来评估底层数据集的公平性。其次,提出了一种现有偏差缓解方法FairDo的新应用。我们表明,该策略可以通过转换数据集来缓解任何类型的歧视,包括交叉歧视。通过在真实世界数据集(Adult、Bank、COMPAS)上进行实验,我们证明了具有多个受保护属性的数据集去偏是可能的。所有转换后的数据集在歧视方面平均减少了28%。此外,与原始数据集相比,这些数据集没有显著损害任何测试的机器学习模型的性能。总之,本研究证明了所用缓解策略的有效性,并为欧盟《人工智能法案》实施的持续讨论做出了贡献。
引用
@article{arxiv.2405.19300,
title = {Measuring and Mitigating Bias for Tabular Datasets with Multiple Protected Attributes},
author = {Manh Khoi Duong and Stefan Conrad},
journal= {arXiv preprint arXiv:2405.19300},
year = {2024}
}
备注
Submission accepted in AEQUITAS'24 (co-located with ECAI 2024)