中文

变分线性注意力:长上下文变换器的稳定关联记忆

机器学习 2026-05-13 v1

摘要

线性注意力将softmax注意力的二次计算成本降低至O(T)\mathcal{O}(T),但其内存状态的弗罗贝尼乌斯范数随时间增长为O(T)\mathcal{O}(T),导致存储关联之间的逐渐干扰。我们提出\textbf{变分线性注意力}(VLA),将内存更新重新表述为具有自适应惩罚矩阵的在线正则化最小二乘问题,通过Sherman-Morrison秩1公式维护该惩罚矩阵。我们证明,规范化写入方向为单位长度可得迭代雅可比谱范数恰为1(命题2),且在有界输入下,状态范数自我限制(命题1)。经验上,VLA在T=1,000T{=}1{,}000时将StF\|S_t\|_F相对于标准线性注意力降低109×109\times,在有效每头记忆 regime内实现多查询关联记忆的近乎完美的精确匹配准确率(npairs<dhn_\text{pairs} < d_h),在记忆负载增加的情况下显著优于DeltaNet和标准线性注意力,保持62%的准确率以达到每头容量边界。一种Triton融合内核相对于顺序Python实现实现14×14\times的加速,实现O(T)\mathcal{O}(T)规模,约在43,000个token处跨越低于softmax注意力延迟。

关键词

引用

@article{arxiv.2605.11196,
  title  = {Variational Linear Attention: Stable Associative Memory for Long-Context Transformers},
  author = {Vishal Pandey and Gopal Singh},
  journal= {arXiv preprint arXiv:2605.11196},
  year   = {2026}
}

备注

20 pages