通过正交记忆实现线性注意力
计算与语言
2023-12-19 v1
摘要
高效注意力机制极大地提高了 Transformers 的计算效率。然而,大多数现有的线性注意力机制都存在\emph{效率退化}问题,导致在因果语言建模中效率低下,并阻碍了其在长程语言模型中的应用。在无界上下文的语言建模下,这一问题更为显著。在本文中,我们提出了\textbf{L}inear \textbf{A}ttention \textbf{V}ia \textbf{O}rthogonal memory~(\shortname) 以解决这些局限性,在保持线性复杂度的同时实现了强大的性能。\shortname 采用正交分解将上下文压缩为固定大小的正交记忆,同时有效地最小化上下文内的冗余。鉴于正交记忆压缩了全局信息,我们进一步剖析上下文以放大细粒度的局部信息。此外,我们将相对位置编码嵌入到\shortname 中以改善外推能力。实验结果表明,\shortname 极大地提高了因果语言模型的效率,具有最佳的外推性能,并优于其他高效基线。此外,我们致力于将\shortname 用于无界语言建模,并成功将上下文长度扩展至 128K。
引用
@article{arxiv.2312.11135,
title = {Linear Attention via Orthogonal Memory},
author = {Jun Zhang and Shuyang Jiang and Jiangtao Feng and Lin Zheng and Lingpeng Kong},
journal= {arXiv preprint arXiv:2312.11135},
year = {2023}
}
备注
16 pages