中文

TaCo:目标概念擦除防止非线性分类器检测受保护属性

计算与语言 2024-10-17 v4 机器学习

摘要

确保自然语言处理模型的公平性至关重要,因为它们常常编码了性别和种族等敏感属性,导致有偏见的输出。当前的概念擦除方法试图通过修改最终潜在表征来移除敏感信息,而无需重新训练整个模型,从而缓解此问题。然而,这些方法通常依赖于线性分类器,这使得模型容易受到能够恢复敏感信息的非线性对手的攻击。我们引入了目标概念擦除 (TaCo),这是一种从最终潜在表征中移除敏感信息的新方法,即使面对非线性分类器也能确保公平性。我们的实验表明,TaCo 优于最先进的方法,在保持整体任务性能的同时,通过非线性分类器实现了对敏感属性预测准确度的更大降低。代码可在 https://github.com/fanny-jourdan/TaCo 获取。

关键词

引用

@article{arxiv.2312.06499,
  title  = {TaCo: Targeted Concept Erasure Prevents Non-Linear Classifiers From Detecting Protected Attributes},
  author = {Fanny Jourdan and Louis Béthune and Agustin Picard and Laurent Risser and Nicholas Asher},
  journal= {arXiv preprint arXiv:2312.06499},
  year   = {2024}
}