中文

注意力究竟关注了多少?对预训练 Transformer 中注意力重要性的质疑

计算与语言 2022-11-08 v1 机器学习

摘要

注意力机制被广泛使用的 Transformer 架构视为支柱。它通过计算输入相关的注意力矩阵来实现输入上下文化。我们发现,这一机制虽然强大且优雅,但对于预训练语言模型而言并不像通常认为的那么重要。我们提出 PAPA,一种用恒定矩阵——多个输入上的平均注意力权重——替换输入相关注意力矩阵的新探测方法。我们使用 PAPA 在六个下游任务上分析若干成熟的预训练 Transformer。我们发现,在没有输入相关注意力的情况下,所有模型都取得了有竞争力的性能——相对于探测基线平均仅下降 8%。此外,当将一半的输入相关注意力矩阵替换为恒定(输入无关)矩阵时,观察到极少或无性能下降。有趣的是,我们表明性能更好的模型应用我们的方法后损失更多,说明输入相关注意力机制的利用可能是其成功的一个因素。我们的结果激励了对输入相关注意力的更简替代方案,以及 Transformer 架构中更好利用该机制方法的研究。

关键词

引用

@article{arxiv.2211.03495,
  title  = {How Much Does Attention Actually Attend? Questioning the Importance of Attention in Pretrained Transformers},
  author = {Michael Hassid and Hao Peng and Daniel Rotem and Jungo Kasai and Ivan Montero and Noah A. Smith and Roy Schwartz},
  journal= {arXiv preprint arXiv:2211.03495},
  year   = {2022}
}

备注

Findings of EMNLP 2022