中文

通过句子编辑探究语言模型的可解释性

计算与语言 2021-09-28 v2

摘要

诸如 BERT 之类的预训练语言模型(PLMs)正被用于几乎所有与语言相关的任务,但对其行为的解读仍是一项重大挑战,许多重要问题在很大程度上仍未得到解答。在这项工作中,我们重新利用了一个句子编辑数据集,其中忠实的高质量人类理据(rationale)可自动提取并与提取的模型理据进行比较,作为可解释性的新测试平台。这使我们能够对有关 PLM 可解释性的一系列问题开展系统性研究,包括预训练过程的作用、理据提取方法的比较以及 PLM 中不同层的情况。该探究产生了新的见解,例如,与通常理解相反,我们发现注意力权重与人类理据相关性良好,并且在提取模型理据方面优于基于梯度的显著性。数据集与代码均已发布于 https://github.com/samuelstevens/sentence-editing-interpretability,以促进未来的可解释性研究。

关键词

引用

@article{arxiv.2011.14039,
  title  = {An Investigation of Language Model Interpretability via Sentence Editing},
  author = {Samuel Stevens and Yu Su},
  journal= {arXiv preprint arXiv:2011.14039},
  year   = {2021}
}

备注

12 pages, 9 figures. Accepted at EMNLP BlackboxNLP 2021