数据准备对软件系统公平性的影响
机器学习
2019-10-08 v1 人工智能
机器学习
摘要
机器学习模型被广泛采用在直接影响人们的场景中。基于这些模型开发软件系统引发了社会与法律层面的担忧,因为其决策可能导致基于种族或性别等属性的个体受到不公平对待。数据准备是任何机器学习流程中的关键环节,但其对公平性的影响尚待详细研究。在本文中,我们评估了敏感属性的移除、类别属性的编码以及实例选择方法(包括交叉验证器和随机欠采样)如何影响所学模型的公平性与有效性。我们使用了被广泛研究且已知存在公平性问题的 Adult Income 和 German Credit Data 数据集。我们单独应用每种数据准备技术,以使用统计奇偶差异、差异影响和归一化偏见指数分析预测性能与公平性的差异。结果表明,公平性受到对训练数据所做变换的影响,尤其在非平衡数据集中。如预期,移除敏感属性不足以消除预测中的所有不公平,但它是实现更公平模型的关键。此外,相对于真实标签的标准随机欠采样有时比不进行随机欠采样更具偏见性。
引用
@article{arxiv.1910.02321,
title = {The Impact of Data Preparation on the Fairness of Software Systems},
author = {Inês Valentim and Nuno Lourenço and Nuno Antunes},
journal= {arXiv preprint arXiv:1910.02321},
year = {2019}
}