无需重训练的补救:利用反事实分布避免差异影响
机器学习
2019-05-20 v2 计算机与社会
信息论
math.IT
机器学习
摘要
当机器学习模型在由敏感属性(例如性别或种族)定义的群体上的性能存在差异时,这种性能差异可以用每个群体上输入和输出变量的概率分布来表达。在本文中,我们利用这一事实来减少固定分类模型在关注群体上的差异影响。给定一个黑盒分类器,我们的目标是通过扰动弱势群体的输入变量分布来消除性能差距。我们将扰动后的分布称为反事实分布,并刻画其在常见公平性准则下的性质。我们引入了一种下降算法来从数据中学习反事实分布。然后我们讨论如何使用估计的分布来构建一个数据预处理器,从而在不训练新模型的情况下减少差异影响。我们通过真实世界数据集上的实验验证了我们的方法,表明其可以在准确率不显著下降的情况下修复不同形式的差异。
引用
@article{arxiv.1901.10501,
title = {Repairing without Retraining: Avoiding Disparate Impact with Counterfactual Distributions},
author = {Hao Wang and Berk Ustun and Flavio P. Calmon},
journal= {arXiv preprint arXiv:1901.10501},
year = {2019}
}