神经模型的病态行为使解释变得困难
计算与语言
2022-09-07 v3
摘要
解释神经模型预测的一种方法是突出最重要的输入特征——例如,对输入句子中的词进行热力图可视化。在现有的 NLP 解释方法中,一个词的重要性由输入扰动(测量移除该词后模型置信度的下降)或关于该词的梯度来决定。为了理解这些方法的局限性,我们使用输入约简,即迭代地从输入中移除最不重要的词。这暴露了神经模型的病态行为:剩余的词对人类而言看似无意义,且并非解释方法所确定的重要词。正如我们通过人类实验所证实的,约简后的例子缺乏支持任何标签预测的信息,但模型仍以高置信度做出相同的预测。为了解释这些反直觉的结果,我们将其与对抗样本和置信度校准联系起来:病态行为揭示了解释以最大似然训练的神经模型的困难。为了缓解其缺陷,我们通过鼓励约简例子上的高熵输出来微调模型。微调后的模型在输入约简下变得更具可解释性,同时在常规例子上不损失准确率。
引用
@article{arxiv.1804.07781,
title = {Pathologies of Neural Models Make Interpretations Difficult},
author = {Shi Feng and Eric Wallace and Alvin Grissom and Mohit Iyyer and Pedro Rodriguez and Jordan Boyd-Graber},
journal= {arXiv preprint arXiv:1804.07781},
year = {2022}
}
备注
EMNLP 2018 camera ready