中文

迈向 NLP 中忠实的模型解释:一篇综述

计算与语言 2024-01-17 v4

摘要

端到端神经自然语言处理(NLP)模型众所周知难以理解。这促使近年来出现了大量关于模型可解释性的工作。模型解释的一个期望特性是忠实性,即解释应准确表示模型预测背后的推理过程。在本综述中,我们通过忠实性的视角回顾了 NLP 中超过 110 种模型解释方法。我们首先讨论忠实性的定义与评估,及其对可解释性的意义。然后介绍忠实解释的最新进展,将现有方法分为五类:基于相似性的方法、模型内部结构分析、基于反向传播的方法、反事实干预以及自解释模型。对于每一类,我们综合了其代表性研究、优势与不足。最后,我们总结了它们的共同优点与剩余挑战,并思考了 NLP 中迈向忠实可解释性的未来工作方向。

关键词

引用

@article{arxiv.2209.11326,
  title  = {Towards Faithful Model Explanation in NLP: A Survey},
  author = {Qing Lyu and Marianna Apidianaki and Chris Callison-Burch},
  journal= {arXiv preprint arXiv:2209.11326},
  year   = {2024}
}

备注

Added acknowledgements; Accepted to the Computational Linguistics Journal (June 2024 issue)