中文

对抗学习公平表示时的数据决策与理论启示

机器学习 2017-07-10 v2 计算机与社会

摘要

当我们不知道分类器的输入是否属于受保护群体时,如何学习一个对该受保护或敏感群体“公平”的分类器?当受保护群体的数据难以获取时,我们如何训练这样的分类器?在许多场景中,即使在模型训练期间,确定敏感输入属性也可能成本高昂,而在模型服务时有时甚至不可能。例如,在推荐系统中,若想预测用户是否会点击某推荐,我们常不知道用户的许多属性(如种族或年龄),且内容的许多属性也难以确定(如语言或主题)。因此,使用基于敏感属性知识校准的不同分类器是不可行的。此处,我们采用对抗训练过程,从神经网络学习的潜在表示中移除关于敏感属性的信息。具体而言,我们研究对抗训练的数据选择如何影响最终的公平性属性。我们发现两个有趣结果:训练这些对抗模型仅需少量数据,且数据分布从经验上驱动了对手的公平性概念。

关键词

引用

@article{arxiv.1707.00075,
  title  = {Data Decisions and Theoretical Implications when Adversarially Learning Fair Representations},
  author = {Alex Beutel and Jilin Chen and Zhe Zhao and Ed H. Chi},
  journal= {arXiv preprint arXiv:1707.00075},
  year   = {2017}
}

备注

Presented as a poster at the 2017 Workshop on Fairness, Accountability, and Transparency in Machine Learning (FAT/ML 2017)