通过表示中性化实现公平性
机器学习
2021-10-28 v2 人工智能
计算机与社会
机器学习
摘要
现有的针对 DNN 模型的偏见缓解方法主要致力于学习去偏编码器。这一过程不仅需要大量敏感属性的实例级标注,也无法保证所有公平性敏感信息都已从编码器中移除。为应对这些局限,我们探究以下研究问题:即使以有偏表示为输入,我们能否仅通过对分类头去偏来降低 DNN 模型的歧视性?为此,我们提出一种新的缓解技术,即面向公平性的表示中性化(RNF),它通过仅对 DNN 模型的任务特定分类头去偏来实现公平性。具体而言,我们利用具有相同真实标签但不同敏感属性的样本,并使用它们的中性化表示来训练 DNN 模型的分类头。RNF 的核心思想是阻止分类头捕获编码器表示中公平性敏感信息与特定类标签之间的虚假关联。针对无法获取敏感属性标注的低资源场景,我们利用偏见放大模型生成敏感属性的代理标注。在多个基准数据集上的实验结果表明,我们的 RNF 框架能有效降低 DNN 模型的歧视性,且任务特定性能下降极小。
引用
@article{arxiv.2106.12674,
title = {Fairness via Representation Neutralization},
author = {Mengnan Du and Subhabrata Mukherjee and Guanchu Wang and Ruixiang Tang and Ahmed Hassan Awadallah and Xia Hu},
journal= {arXiv preprint arXiv:2106.12674},
year = {2021}
}
备注
Accepted by NeurIPS 2021