LoLA:基于稀疏缓存的低秩线性注意力
计算与语言
2025-10-01 v2 机器学习
摘要
Transformer 推理的每词元成本随上下文长度而增加,阻碍了其在终身上下文学习中的应用。线性注意力是一种高效的替代方案,即使在无限上下文长度下也能保持恒定的内存占用。虽然这是终身学习的潜在候选者,但其在内存容量方面存在不足。在本文中,我们提出了 LoLA,一种免训练的线性注意力增强方法,可提升关联召回能力。LoLA 将来自上下文的过去键值对分配到三个内存系统中: 局部滑动窗口缓存中的近期对; 稀疏全局缓存中的难以记忆对; 线性注意力循环隐藏状态中的通用对。我们通过消融实验表明,我们的自召回错误度量对于高效管理长期关联记忆至关重要。在密钥检索任务上,LoLA 将基础模型的性能从 0.6% 提升至 97.4% 的准确率。这是在 4K 上下文长度下,以比 Llama-3.1 8B 小 4.6 倍的缓存实现的。LoLA 在零样本常识推理任务上也优于其他 1B 和 8B 参数的次二次模型。
引用
@article{arxiv.2505.23666,
title = {LoLA: Low-Rank Linear Attention With Sparse Caching},
author = {Luke McDermott and Robert W. Heath and Rahul Parhi},
journal= {arXiv preprint arXiv:2505.23666},
year = {2025}
}