中文

量化Transformer中的注意力流

机器学习 2020-06-02 v2 人工智能 计算与语言

摘要

在Transformer模型中,“自注意力”将来自被关注嵌入的信息整合到下一层焦点嵌入的表示中。因此,在Transformer的各层之间,来自不同词符的信息愈发混合。这使得注意力权重作为解释探针并不可靠。本文考虑通过自注意力量化这种信息流的问题。我们提出了两种在给定注意力权重时近似输入词符注意力的方法——注意力展开(attention rollout)与注意力流(attention flow),将其作为使用注意力权重作为输入词符相对相关性时的事后分析方法。我们表明,这些方法给出了关于信息流的互补视角,并且与原始注意力相比,二者均与通过消融方法和输入梯度获得的输入词符重要性分数具有更高的相关性。

关键词

引用

@article{arxiv.2005.00928,
  title  = {Quantifying Attention Flow in Transformers},
  author = {Samira Abnar and Willem Zuidema},
  journal= {arXiv preprint arXiv:2005.00928},
  year   = {2020}
}