中文

度量Transformer中上下文信息的混合

计算与语言 2022-10-25 v3

摘要

Transformer架构通过自注意力机制聚合输入信息,但目前尚不清楚这些信息如何在整个模型中被混合。此外,近期工作表明仅注意力权重不足以描述信息流。在本文中,我们考虑完整的注意力块——多头注意力、残差连接和层归一化——并定义了一种度量每层内词元到词元交互的指标。随后,我们聚合逐层解释,为模型预测提供输入归因分数。在实验中,我们表明我们的方法ALTI(逐层词元到词元交互聚合)比基于梯度的方法提供更忠实的解释且鲁棒性更强。

关键词

引用

@article{arxiv.2203.04212,
  title  = {Measuring the Mixing of Contextual Information in the Transformer},
  author = {Javier Ferrando and Gerard I. Gállego and Marta R. Costa-jussà},
  journal= {arXiv preprint arXiv:2203.04212},
  year   = {2022}
}

备注

EMNLP 2022