中文

Synthesizer:重新思考 Transformer 模型中的自注意力

计算与语言 2021-05-25 v3 信息检索 机器学习

摘要

点积自注意力被认为是最先进 Transformer 模型的核心且不可或缺的组成部分。但它真的是必需的吗?本文研究了基于点积的自注意力机制对 Transformer 模型性能的真正重要性与贡献。通过大量实验,我们发现(1)随机对齐矩阵出人意料地表现极具竞争力,且(2)从 token-token(查询-键)交互中学习注意力权重是有用的,但终究并非那么重要。为此,我们提出了 \textsc{Synthesizer},一种无需 token-token 交互即可学习合成注意力权重的模型。在我们的实验中,我们首先表明,在一系列任务(包括机器翻译、语言建模、文本生成以及 GLUE/SuperGLUE 基准)中,简单的 Synthesizer 与原始 Transformer 模型相比取得了极具竞争力的性能。当与点积注意力组合时,我们发现 Synthesizer 始终优于 Transformer。此外,我们将 Synthesizer 与动态卷积进行了额外比较,表明简单的随机 Synthesizer 不仅快 60%60\%,还将困惑度相对改善了 3.5%3.5\%。最后,我们展示了简单的因式分解 Synthesizer 在仅编码任务上可以优于 Linformer。

关键词

引用

@article{arxiv.2005.00743,
  title  = {Synthesizer: Rethinking Self-Attention in Transformer Models},
  author = {Yi Tay and Dara Bahri and Donald Metzler and Da-Cheng Juan and Zhe Zhao and Che Zheng},
  journal= {arXiv preprint arXiv:2005.00743},
  year   = {2021}
}

备注

ICML 2021