中文

无需重训练的补救:利用反事实分布避免差异影响

机器学习 2019-05-20 v2 计算机与社会 信息论 math.IT 机器学习

摘要

当机器学习模型在由敏感属性(例如性别或种族)定义的群体上的性能存在差异时,这种性能差异可以用每个群体上输入和输出变量的概率分布来表达。在本文中,我们利用这一事实来减少固定分类模型在关注群体上的差异影响。给定一个黑盒分类器,我们的目标是通过扰动弱势群体的输入变量分布来消除性能差距。我们将扰动后的分布称为反事实分布,并刻画其在常见公平性准则下的性质。我们引入了一种下降算法来从数据中学习反事实分布。然后我们讨论如何使用估计的分布来构建一个数据预处理器,从而在不训练新模型的情况下减少差异影响。我们通过真实世界数据集上的实验验证了我们的方法,表明其可以在准确率不显著下降的情况下修复不同形式的差异。

关键词

引用

@article{arxiv.1901.10501,
  title  = {Repairing without Retraining: Avoiding Disparate Impact with Counterfactual Distributions},
  author = {Hao Wang and Berk Ustun and Flavio P. Calmon},
  journal= {arXiv preprint arXiv:1901.10501},
  year   = {2019}
}