高效序列建模的原生混合注意力
计算与语言
2026-04-16 v3 人工智能
机器学习
摘要
Transformer 在序列建模方面表现优异,但面临二次时间复杂度;而线性注意力虽提高了效率,但常在长程上下文召回准确性方面妥协。本文引入原生混合注意力 (Native Hybrid Attention, NHA),一种新型的线性注意力与全注意力混合架构,将注意力层内混合与层间混合统一集成于单一层设计中。NHA 通过线性 RNN 更新关键值槽以维持长期上下文,并增添滑动窗口中的短期 token。随后对所有 key 与 value 执行单次 softmax 注意力操作,实现基于 token 与基于头的上下文依赖加权,无需额外融合参数。层间行为通过单一超参数——滑动窗口大小——进行控制,实现从纯线性注意力向全注意力的平滑转换,同时保持所有层结构统一。实验结果表明,NHA 在召回密集型和常识推理任务上超越 Transformer 和其他混合基线。此外,预训练的大语言模型可采用 NHA 进行结构化混合,实现准竞争精度的同时显著提升效率。代码已公开于 https://github.com/JusenD/NHA。
引用
@article{arxiv.2510.07019,
title = {Native Hybrid Attention for Efficient Sequence Modeling},
author = {Jusen Du and Jiaxi Hu and Tao Zhang and Weigao Sun and Yu Cheng},
journal= {arXiv preprint arXiv:2510.07019},
year = {2026}
}
备注
Accepted by ACL 2026, 17 pages