中文

Neural Attention Search Linear:面向自适应 token 级别混合注意力模型

计算与语言 2026-02-04 v1 机器学习

摘要

Softmax 注意力模型在长序列情境下的二次计算复杂度已成为瓶颈。相比之下,线性注意力模型家族为更高效的序列模型提供了可行方向。这些线性注意力模型将过去的 KV 值压缩为单个隐藏状态,从而在训练和推理期间有效降低复杂度。然而,其表达能力受限于隐藏状态的大小。以前的工作提出在softmax注意力层和线性注意力层之间交错,以减少计算复杂度而保持表达能力。尽管如此,这些模型的效率仍受softmax注意力层的瓶颈。本文提出 Neural Attention Search Linear(NAtS-L),该框架在同一层的不同 token 上应用线性注意力和softmax注意力操作。NAtS-L 自动确定某个 token 是否可以由线性注意力模型处理,即该 token 仅具有短期影响,可编码为固定大小的隐藏状态,或需要softmax注意力,即该 token 包含与长期检索相关的信息,需要为未来查询保留。通过在 token 上搜索最佳 Gated DeltaNet 和softmax注意力组合,我们展示 NAtS-L 提供了一个强大且高效的 token 级别混合架构。

关键词

引用

@article{arxiv.2602.03681,
  title  = {Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models},
  author = {Difan Deng and Andreas Bentzen Winje and Lukas Fehring and Marius Lindauer},
  journal= {arXiv preprint arXiv:2602.03681},
  year   = {2026}
}

备注

17 pages, 8 figures