通过联合子空间估计从神经网络表示中移除虚假概念
机器学习
2024-07-24 v2 机器学习
摘要
神经网络中的分布外泛化常受虚假相关性阻碍。一种常见策略是通过从数据的神经网络表示中移除虚假概念来缓解此问题。现有的概念移除方法往往过于激进,无意中消除了与模型主任务相关的特征,从而损害模型性能。我们提出一种迭代算法,通过在神经网络表示中联合识别两个低维正交子空间,将虚假概念与主任务概念分离。我们在计算机视觉(Waterbirds、CelebA)与自然语言处理(MultiNLI)的基准数据集上评估该算法,表明其优于现有的概念移除方法。
引用
@article{arxiv.2310.11991,
title = {Removing Spurious Concepts from Neural Network Representations via Joint Subspace Estimation},
author = {Floris Holstege and Bram Wouters and Noud van Giersbergen and Cees Diks},
journal= {arXiv preprint arXiv:2310.11991},
year = {2024}
}
备注
Preprint. Under Review. 33 pages