中文

Mega:配备移动平均的门控注意力

机器学习 2023-01-31 v3

摘要

Transformer 注意力机制中的设计选择,包括较弱的归纳偏置和二次计算复杂度,限制了其在长序列建模中的应用。在本文中,我们引入 Mega,一种简单的、有理论依据的、单头门控注意力机制,配备(指数)移动平均,以将位置感知局部依赖的归纳偏置纳入位置无关的注意力机制中。我们进一步提出 Mega 的一个变体,通过高效地将整个序列分割成多个固定长度的块,提供线性的时间和空间复杂度且仅带来极小的质量损失。在广泛序列建模基准上的大量实验,包括 Long Range Arena、神经机器翻译、自回归语言建模以及图像和语音分类,表明 Mega 相比其他序列模型(包括 Transformer 的变体和近期状态空间模型)取得了显著改进。

关键词

引用

@article{arxiv.2209.10655,
  title  = {Mega: Moving Average Equipped Gated Attention},
  author = {Xuezhe Ma and Chunting Zhou and Xiang Kong and Junxian He and Liangke Gui and Graham Neubig and Jonathan May and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2209.10655},
  year   = {2023}
}

备注

Accepted by ICLR 2023. Final version (updating MT results). 13 pages, 4 figures and 7 tables