中文

面向反事实公平性的对抗学习

机器学习 2020-09-01 v1 人工智能 计算机与社会 机器学习

摘要

近年来,公平性已成为机器学习研究界的一个重要课题。特别地,反事实公平性旨在构建在最具个体层面确保公平的预测模型。其思想不是在全球范围内考虑整个人群的公平,而是设想任何个体在给定关注属性(例如不同的性别或种族)发生变化时会是什么样子。现有方法依赖于个体的变分自编码,使用最大均值差异(MMD)惩罚来限制推断表示与其相应敏感属性之间的统计依赖性。这使得能够模拟用于训练目标公平模型的反事实样本,目标是为任何个体的每个替代版本产生相似结果。在本工作中,我们提出依赖对抗神经学习方法,其能够实现比 MMD 惩罚更强大的推断,并且特别更适合连续设定,即敏感属性的值无法被穷举枚举的情况。实验显示了在离散与连续设定下反事实公平性的显著提升。

关键词

引用

@article{arxiv.2008.13122,
  title  = {Adversarial Learning for Counterfactual Fairness},
  author = {Vincent Grari and Sylvain Lamprier and Marcin Detyniecki},
  journal= {arXiv preprint arXiv:2008.13122},
  year   = {2020}
}

备注

11 pages, 5 figures