中文

通过照亮重要信息更好地解释 Transformer

计算与语言 2024-01-29 v3

摘要

基于 Transformer 的模型在各种自然语言处理 (NLP) 任务中表现出色,吸引了无数 efforts 来解释其内部工作机制。先前的方法通过关注原始梯度和注意力作为词元归因分数来解释 Transformer,其中在解释计算过程中往往考虑了不相关信息,导致结果令人困惑。在这项工作中,我们提出在逐层相关性传播 (LRP) 方法之上,通过精细化的信息流来突出重要信息并消除不相关信息。具体而言,我们将识别句法和位置头作为重要的注意力头,并专注于从这些重要头获得的相关性。实验结果表明,不相关信息确实会扭曲输出归因分数,因此应在解释计算过程中将其掩蔽。与分类和问答数据集上的八个基线相比,我们的方法在解释指标上 consistently 表现出超过 3\% 到 33\% 的提升,提供了卓越的解释性能。我们的匿名代码仓库地址为:https://github.com/LinxinS97/Mask-LRP

关键词

引用

@article{arxiv.2401.09972,
  title  = {Better Explain Transformers by Illuminating Important Information},
  author = {Linxin Song and Yan Cui and Ao Luo and Freddy Lecue and Irene Li},
  journal= {arXiv preprint arXiv:2401.09972},
  year   = {2024}
}