中文

高阶线性注意力

机器学习 2026-05-15 v3 人工智能 计算与语言

摘要

缩放点积注意力的二次计算成本是扩大自回归语言模型到长上下文的核心障碍。线性时间注意力和状态空间模型(SSM)提供了可扩展的替代方案,但通常仅限于一阶或基于核函数的近似,这会限制其表达能力。我们提出高阶线性注意力(Higher-order Linear Attention,HLA),这是一种因果的、流式的机制,通过紧凑的前缀充足统计实现高阶交互。在二阶情况下,HLA 保持常数大小的状态,并以线性时间计算每个标记的输出,无需构造任何 n×nn \times n 矩阵。我们给出闭形式的流式恒等式,一个严格因果的掩码变体使用两个额外的摘要,并基于关联扫描的块并行训练方案,精确复现串行递归的激活。我们进一步概述了对三阶及更高阶的扩展。总体而言,这些结果将 HLA 定位为一种原则性、可扩展的构建模块,将类似注意力的数据依赖混合与现代递归架构的效率相结合。

关键词

引用

@article{arxiv.2510.27258,
  title  = {Higher-order Linear Attention},
  author = {Yifan Zhang and Zhen Qin and Mengdi Wang and Quanquan Gu},
  journal= {arXiv preprint arXiv:2510.27258},
  year   = {2026}
}

备注

Project Page: https://github.com/yifanzhang-pro/HLA