置零处理:通过迭代零空间投影保护受保护属性
计算与语言
2020-04-30 v2 机器学习
摘要
控制神经表示中所编码信息类型的能力具有多种用途,尤其是在解释这些模型面临挑战的背景下。我们提出迭代零空间投影(INLP),一种从神经表示中移除信息的新方法。我们的方法基于重复训练预测我们旨在移除的某一属性的线性分类器,随后将表示投影到其零空间上。通过这样做,分类器对该目标属性变得不敏感,使得根据它线性分离数据变得困难。虽然可应用于多种用途,我们在偏见与公平性用例上评估了我们的方法,并表明我们的方法能够缓解词嵌入中的偏见,并在多类分类设定中提高公平性。
引用
@article{arxiv.2004.07667,
title = {Null It Out: Guarding Protected Attributes by Iterative Nullspace Projection},
author = {Shauli Ravfogel and Yanai Elazar and Hila Gonen and Michael Twiton and Yoav Goldberg},
journal= {arXiv preprint arXiv:2004.07667},
year = {2020}
}
备注
Accepted as a long paper in ACL 2020