探测分类器在概念移除与检测中不可靠
机器学习
2023-06-21 v3 计算与语言
摘要
已在文本数据上训练的神经网络模型被发现在其表示中编码了不良的语言或敏感概念。由于概念、文本输入与所学表示之间关系复杂,移除此类概念并非易事。近期工作提出了事后方法与对抗方法来从模型表示中移除此类不想要的概念。通过广泛的理论与实证分析,我们表明这些方法可能适得其反:它们无法完全移除概念,且在最坏情况下可能破坏所有任务相关特征。原因在于这些方法依赖探测分类器(probing classifier)作为概念的代理。即使在最有利于学习探测分类器的条件下——当概念在表示空间中的相关特征单独即可提供100%准确率时——我们证明探测分类器很可能利用非概念特征,从而事后或对抗方法将无法正确移除概念。这些理论推论在合成数据、Multi-NLI与Twitter数据集上训练的模型的实验中得到证实。对于概念移除的敏感应用(如公平性),我们建议谨慎使用这些方法,并提出一种伪相关性(spuriousness)度量来评估最终分类器的质量。
引用
@article{arxiv.2207.04153,
title = {Probing Classifiers are Unreliable for Concept Removal and Detection},
author = {Abhinav Kumar and Chenhao Tan and Amit Sharma},
journal= {arXiv preprint arXiv:2207.04153},
year = {2023}
}