中文

屏蔽表示:通过迭代梯度投影保护敏感属性

计算与语言 2023-05-18 v1 人工智能

摘要

自然语言处理模型倾向于学习并编码数据中存在的社会偏见。解决此类偏见的一种流行方法是消除模型表示中编码的信息。然而,当前的方法仅限于去除线性编码的信息。在这项工作中,我们提出了一种新方法——迭代梯度投影(IGBP),用于从神经表示中去除非线性编码的概念。我们的方法包括迭代训练神经分类器以预测我们试图消除的特定属性,随后将表示投影到超曲面上,使得分类器对目标属性变得不可察觉。我们在去除性别和种族信息作为敏感属性的任务上评估了该方法的有效性。我们的结果表明,IGBP在通过内在和外在评估减轻偏见方面是有效的,且对下游任务准确率的影响最小。

关键词

引用

@article{arxiv.2305.10204,
  title  = {Shielded Representations: Protecting Sensitive Attributes Through Iterative Gradient-Based Projection},
  author = {Shadi Iskander and Kira Radinsky and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2305.10204},
  year   = {2023}
}

备注

This paper will be published in the proceedings of Findings of ACL 2023