神经语言模型显著性方法的评估
计算与语言
2021-04-14 v1
摘要
显著性方法被广泛用于解释神经网络预测,但不同变体的显著性方法即使对同一模型同一预测的解释也常常不一致。在这些情况下,我们如何判断这些解释是否足够可信以用于分析?为解答该问题,我们在一个基础的 NLP 模型类别——神经语言模型上,对显著性方法进行全面定量评估。我们从两个各代表这些解释理想性质的视角评估预测解释的质量:合理性与忠实性。我们的评估在基于现有句法和语义一致人类标注构建的四个不同数据集上进行,涵盖句子级和文档级。通过评估,我们识别出显著性方法产生低质量解释的各种方式。我们建议未来将此类方法部署到神经语言模型的工作应在得出见解前仔细验证其解释。
引用
@article{arxiv.2104.05824,
title = {Evaluating Saliency Methods for Neural Language Models},
author = {Shuoyang Ding and Philipp Koehn},
journal= {arXiv preprint arXiv:2104.05824},
year = {2021}
}
备注
19 pages, 2 figures, Accepted for NAACL 2021