中文

通过对抗学习缓解非期望偏差

机器学习 2018-01-25 v1 人工智能 计算机与社会

摘要

机器学习是一种用于构建准确表示输入训练数据之模型的工具。当训练数据中存在关于人口群体的非期望偏差时,训练良好的模型会反映这些偏差。我们提出一种通过引入感兴趣群体的变量并同时学习一个预测器与一个对抗器来缓解此类偏差的框架。网络输入X(此处为文本或人口普查数据)产生预测Y(如类比补全或收入区间),而对抗器试图建模受保护变量Z(此处为性别或邮政编码)。目标是最大化预测器预测Y的能力,同时最小化对抗器预测Z的能力。应用于类比补全时,该方法所得预测准确且表现出较少的Z刻板印象证据。当应用于使用UCI Adult(人口普查)数据集的分类任务时,所得预测模型在几乎实现均等赔率(Hardt等,2016)的同时未损失太多精度。该方法灵活,可适用于多种公平性定义以及广泛的基于梯度的学习模型,包括回归与分类任务。

关键词

引用

@article{arxiv.1801.07593,
  title  = {Mitigating Unwanted Biases with Adversarial Learning},
  author = {Brian Hu Zhang and Blake Lemoine and Margaret Mitchell},
  journal= {arXiv preprint arXiv:1801.07593},
  year   = {2018}
}