非线性概念擦除:基于密度匹配的方法
机器学习
2025-08-19 v2 计算与语言
摘要
确保用于实际应用的神经模型无法从文本表示中推断出敏感信息(如性别或种族等人口属性),是公平性 concern 下的关键挑战。我们通过概念擦除(concept erasure)来解决此问题,该过程在保留尽可能多剩余义信息的同时,从分布式表示中移除与特定概念相关的information。我们的方法涉及在嵌入空间中学习一个正交投影,旨在使擦除后离散概念的类别条件特征分布在投影后变得不可区分。通过调整投影器的秩,我们控制信息移除的程度,而其正交性确保严格保留嵌入的局部结构。我们的方法称为 EOPARD,在经典自然语言处理基准测试上实现了对离散属性进行非线性擦除的领先性能。此外,我们证明 EOPARD 能有效缓解深度非线性分类器中的偏见,从而促进公平性。
引用
@article{arxiv.2507.12341,
title = {Nonlinear Concept Erasure: a Density Matching Approach},
author = {Antoine Saillenfest and Pirmin Lemberger},
journal= {arXiv preprint arXiv:2507.12341},
year = {2025}
}
备注
17 pages, 10 figures, accepted for publication in ECAI 2025 (28th European Conference on Artificial Intelligence)