线性概念移除下保持任务相关信息
机器学习
2025-11-17 v2
摘要
现代神经网络常在任务相关信息之外编码出人意料的概念,导致公平性和可解释性问题。现有的事后方法可移除不必要的概念,但常常损坏有用信号。我们提出了 SPLINCE——同时投影用于线性概念移除和协方差保持 - 通过对斜投影实现对敏感概念的消除,同时精确保持其与目标标签的协方差。SPLINCE 通过 '剪接' 移除不必要的方向,却保护重要的标签相关性。理论上,它是唯一能够消除线性概念可预测性并维持目标协方差、同时最小化嵌入扭曲的解。实证上,SPLINCE 在诸如 Bias in Bios 和 Winobias 等基准测试中超越基线,既移除受保护属性,又最小化主任务信息的损伤。
引用
@article{arxiv.2506.10703,
title = {Preserving Task-Relevant Information Under Linear Concept Removal},
author = {Floris Holstege and Shauli Ravfogel and Bram Wouters},
journal= {arXiv preprint arXiv:2506.10703},
year = {2025}
}
备注
Published at NeurIPS 2025