Nystr"omformer:一种基于 Nystr"om 的自注意力近似算法
计算与语言
2021-04-02 v3 机器学习
摘要
Transformers 已成为广泛用于一系列自然语言处理任务的强大工具。驱动 Transformers 卓越性能的一个关键组件是自注意力机制,其编码了其他词元对每个特定词元的影响或依赖。尽管有益,自注意力关于输入序列长度的二次复杂度限制了其对更长序列的应用——这是社区正积极研究的课题。为应对此限制,我们提出 Nystr"{o}mformer——一种在序列长度上表现出良好可扩展性的模型。我们的思路基于适配 Nystr"{o}m 方法以 复杂度近似标准自注意力。Nystr"{o}mformer 的可扩展性使其能应用于具有数千词元的更长序列。我们在 GLUE 基准和 IMDB 评论上以标准序列长度对多个下游任务进行评估,发现我们的 Nystr"{o}mformer 表现相当,或在少数情况下甚至略优于标准自注意力。在 Long Range Arena(LRA)基准的更长序列任务中,Nystr"{o}mformer 相对于其他高效自注意力方法表现良好。我们的代码见 https://github.com/mlpen/Nystromformer。
引用
@article{arxiv.2102.03902,
title = {Nystr\"omformer: A Nystr\"om-Based Algorithm for Approximating Self-Attention},
author = {Yunyang Xiong and Zhanpeng Zeng and Rudrasis Chakraborty and Mingxing Tan and Glenn Fung and Yin Li and Vikas Singh},
journal= {arXiv preprint arXiv:2102.03902},
year = {2021}
}
备注
AAAI 2021; Code and supplement available at https://github.com/mlpen/Nystromformer