Mega:配备移动平均的门控注意力
机器学习
2023-01-31 v3
摘要
Transformer 注意力机制中的设计选择,包括较弱的归纳偏置和二次计算复杂度,限制了其在长序列建模中的应用。在本文中,我们引入 Mega,一种简单的、有理论依据的、单头门控注意力机制,配备(指数)移动平均,以将位置感知局部依赖的归纳偏置纳入位置无关的注意力机制中。我们进一步提出 Mega 的一个变体,通过高效地将整个序列分割成多个固定长度的块,提供线性的时间和空间复杂度且仅带来极小的质量损失。在广泛序列建模基准上的大量实验,包括 Long Range Arena、神经机器翻译、自回归语言建模以及图像和语音分类,表明 Mega 相比其他序列模型(包括 Transformer 的变体和近期状态空间模型)取得了显著改进。
引用
@article{arxiv.2209.10655,
title = {Mega: Moving Average Equipped Gated Attention},
author = {Xuezhe Ma and Chunting Zhou and Xiang Kong and Junxian He and Liangke Gui and Graham Neubig and Jonathan May and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2209.10655},
year = {2023}
}
备注
Accepted by ICLR 2023. Final version (updating MT results). 13 pages, 4 figures and 7 tables