重新思考注意力:Performer 架构
摘要
我们提出 Performers,一类 Transformer 架构,能够以可证明的精度估计常规(softmax)全秩注意力 Transformer,但仅使用线性(而非二次)空间与时间复杂度,且不依赖稀疏性或低秩性等任何先验。为近似 softmax 注意力核,Performers 采用一种新颖的基于正正交随机特征快速注意力方法(FAVOR+),该方法作为可扩展核方法可能具有独立意义。FAVOR+ 也可用于高效建模超出 softmax 的可核化注意力机制。这种表示能力对于首次在大规模任务上准确比较 softmax 与其他核(超出常规 Transformer 能力范围)并研究最优注意力核至关重要。Performers 是与常规 Transformer 完全兼容且具有强理论保证的线性架构:对注意力矩阵的无偏或近无偏估计、一致收敛和低估计方差。我们在从像素预测到文本模型再到蛋白质序列建模的丰富任务上测试了 Performers。我们展示了与其他所考察的高效稀疏与稠密注意力方法具有竞争力的结果,彰显了 Performers 所利用的新型注意力学习范式的有效性。
引用
@article{arxiv.2009.14794,
title = {Rethinking Attention with Performers},
author = {Krzysztof Choromanski and Valerii Likhosherstov and David Dohan and Xingyou Song and Andreea Gane and Tamas Sarlos and Peter Hawkins and Jared Davis and Afroz Mohiuddin and Lukasz Kaiser and David Belanger and Lucy Colwell and Adrian Weller},
journal= {arXiv preprint arXiv:2009.14794},
year = {2022}
}
备注
Published as a conference paper + oral presentation at ICLR 2021. 38 pages. See https://github.com/google-research/google-research/tree/master/protein_lm for protein language model code, and https://github.com/google-research/google-research/tree/master/performer for Performer code. See https://ai.googleblog.com/2020/10/rethinking-attention-with-performers.html for Google AI Blog