基于Shapley值的实例级数据重加权以实现算法公平
机器学习
2024-06-12 v4 人工智能
计算机与社会
摘要
算法公平具有极其重要的社会意义,然而最先进的大规模机器学习模型需要使用经常存在偏差的海量数据集进行训练。在此背景下,侧重于对数据中的偏差进行建模与纠正的预处理方法成为一种有价值的途径。本文提出FairShap,一种新颖的实例级数据重加权方法,通过Shapley值进行数据估值,以实现公平的算法决策。FairShap与模型无关且易于解释。它衡量每个训练数据点对预定义公平性度量的贡献。我们在多个不同性质的最先进数据集上,结合多种训练场景与机器学习模型,对FairShap进行了实证验证,并展示它如何产生比基线更公平且准确率水平相近的模型。我们通过直方图与隐空间可视化来说明FairShap的可解释性。此外,我们进行了效用-公平性研究,并根据数据集大小与特征数量分析了FairShap的计算成本。我们认为,FairShap代表了在可解释且与模型无关的算法公平方法中的一项新颖贡献,即使在仅有有偏训练数据集可用时,也能产生具有竞争力的准确率。
引用
@article{arxiv.2303.01928,
title = {Towards Algorithmic Fairness by means of Instance-level Data Re-weighting based on Shapley Values},
author = {Adrian Arnaiz-Rodriguez and Nuria Oliver},
journal= {arXiv preprint arXiv:2303.01928},
year = {2024}
}
备注
23 pages, 12 figures, 7 tables