中文

线性概念移除下保持任务相关信息

机器学习 2025-11-17 v2

摘要

现代神经网络常在任务相关信息之外编码出人意料的概念,导致公平性和可解释性问题。现有的事后方法可移除不必要的概念,但常常损坏有用信号。我们提出了 SPLINCE——同时投影用于线性概念移除和协方差保持 - 通过对斜投影实现对敏感概念的消除,同时精确保持其与目标标签的协方差。SPLINCE 通过 '剪接' 移除不必要的方向,却保护重要的标签相关性。理论上,它是唯一能够消除线性概念可预测性并维持目标协方差、同时最小化嵌入扭曲的解。实证上,SPLINCE 在诸如 Bias in Bios 和 Winobias 等基准测试中超越基线,既移除受保护属性,又最小化主任务信息的损伤。

关键词

引用

@article{arxiv.2506.10703,
  title  = {Preserving Task-Relevant Information Under Linear Concept Removal},
  author = {Floris Holstege and Shauli Ravfogel and Bram Wouters},
  journal= {arXiv preprint arXiv:2506.10703},
  year   = {2025}
}

备注

Published at NeurIPS 2025