中文

LoLA:基于稀疏缓存的低秩线性注意力

计算与语言 2025-10-01 v2 机器学习

摘要

Transformer 推理的每词元成本随上下文长度而增加,阻碍了其在终身上下文学习中的应用。线性注意力是一种高效的替代方案,即使在无限上下文长度下也能保持恒定的内存占用。虽然这是终身学习的潜在候选者,但其在内存容量方面存在不足。在本文中,我们提出了 LoLA,一种免训练的线性注意力增强方法,可提升关联召回能力。LoLA 将来自上下文的过去键值对分配到三个内存系统中: 局部滑动窗口缓存中的近期对; 稀疏全局缓存中的难以记忆对; 线性注意力循环隐藏状态中的通用对。我们通过消融实验表明,我们的自召回错误度量对于高效管理长期关联记忆至关重要。在密钥检索任务上,LoLA 将基础模型的性能从 0.6% 提升至 97.4% 的准确率。这是在 4K 上下文长度下,以比 Llama-3.1 8B 小 4.6 倍的缓存实现的。LoLA 在零样本常识推理任务上也优于其他 1B 和 8B 参数的次二次模型。

关键词

引用

@article{arxiv.2505.23666,
  title  = {LoLA: Low-Rank Linear Attention With Sparse Caching},
  author = {Luke McDermott and Robert W. Heath and Rahul Parhi},
  journal= {arXiv preprint arXiv:2505.23666},
  year   = {2025}
}