识别解释差异的脆弱性来源:以神经文本分类为例
计算与语言
2022-12-13 v1 人工智能
摘要
近期一些工作观察到,当对模型施加输入侧扰动时,事后解释会出现不稳定性。这引发了人们对事后解释稳定性的兴趣与担忧。然而,遗留问题是:这种不稳定性是由神经网络模型还是由事后解释方法引起的?本文探究导致事后解释不稳定的潜在来源。为分离模型的影响,我们提出一种简单的输出概率扰动方法。与先前的输入侧扰动方法相比,输出概率扰动方法可规避神经模型对解释的潜在影响,从而实现对解释方法的分析。我们使用三种广泛使用的事后解释方法(LIME (Ribeiro et al., 2016)、Kernel Shapley (Lundberg and Lee, 2017a) 与 Sample Shapley (Strumbelj and Kononenko, 2010))评估所提方法。结果表明,事后解释方法具有稳定性,在输出概率扰动下几乎不产生差异解释。该观察表明,神经网络模型可能是脆弱解释的主要来源。
引用
@article{arxiv.2212.05327,
title = {Identifying the Source of Vulnerability in Explanation Discrepancy: A Case Study in Neural Text Classification},
author = {Ruixuan Tang and Hanjie Chen and Yangfeng Ji},
journal= {arXiv preprint arXiv:2212.05327},
year = {2022}
}
备注
EMNLP BlackboxNLP 2022