稳定、快速且准确:基于核化注意力与相对位置编码的方法
机器学习
2021-11-04 v2 计算与语言
机器学习
摘要
注意力模块是 Transformer 中的关键组件,由于其二次复杂度,无法高效地扩展到长序列。许多工作致力于近似原始注意力中的先点积再指数化的 softmax 函数,从而产生了次二次甚至线性复杂度的 Transformer 架构。然而,我们表明这些方法不能应用于超越先点积再指数化风格的更强大的注意力模块,例如带有相对位置编码(RPE)的 Transformer。由于在众多最先进模型中,相对位置编码被作为默认设置,设计能够融入 RPE 的高效 Transformer 颇具吸引力。在本文中,我们提出了一种基于核化注意力之上,为带有 RPE 的 Transformer 加速注意力计算的新方法。基于相对位置编码构成托普利兹(Toeplitz)矩阵的观察,我们从数学上证明带有 RPE 的核化注意力可使用快速傅里叶变换(FFT)高效计算。借助 FFT,我们的方法达到了 的时间复杂度。有趣的是,我们进一步证明恰当地使用相对位置编码可以缓解原始核化注意力的训练不稳定问题。在广泛的任务上,我们通过实验表明我们的模型可以从头开始训练而没有任何优化问题。学习到的模型优于许多高效 Transformer 变体,并且在长序列场景下比标准 Transformer 更快。
引用
@article{arxiv.2106.12566,
title = {Stable, Fast and Accurate: Kernelized Attention with Relative Positional Encoding},
author = {Shengjie Luo and Shanda Li and Tianle Cai and Di He and Dinglan Peng and Shuxin Zheng and Guolin Ke and Liwei Wang and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2106.12566},
year = {2021}
}
备注
NeurIPS 2021, camera ready version