线性对抗概念擦除
机器学习
2024-12-18 v8 计算与语言
摘要
在现代基于文本数据训练的神经网络模型中,所涌现的预训练表示缺乏直接监督。随着这些表示日益用于真实应用,无法对其内容进行控制成为日益重要的问题。我们形式化了识别并擦除对应给定概念的线性子空间的问题,以防止线性预测器恢复该概念。我们将此问题建模为带约束的线性极大极小博弈,并指出已有解通常对此任务并非最优。我们推导了特定目标下的闭式解,并提出一种对这些目标有效的凸松弛方法 \method。在二元性别移除的评估中,该方法恢复了一个低维子空间,其移除通过内在与外在评估缓解了偏差。我们表明该方法具有高度表达力,在保持可处理性与可解释性的同时,有效缓解深度非线性分类器中的偏差。
引用
@article{arxiv.2201.12091,
title = {Linear Adversarial Concept Erasure},
author = {Shauli Ravfogel and Michael Twiton and Yoav Goldberg and Ryan Cotterell},
journal= {arXiv preprint arXiv:2201.12091},
year = {2024}
}
备注
Accepted in ICML 2022; a revised version