基于潜在注意力与局部-全局交替策略的本机稀疏注意力优化
计算与语言
2025-11-04 v1
摘要
本文系统分析了本机稀疏注意力(NSA),并提出针对性的改进措施以增强长序列建模。关键洞察在于,跨层在局部(滑动窗口)与全局(压缩、选择性)注意力之间交替,而非使用固定模式,可更有效地传播长程依赖,显著提升在长序列任务上的性能。与此同时,我们进一步以潜在注意力方式细化 NSA 的各分支:滑动窗口分支增强为多头潜在注意力(MLA),而压缩和选择性分支采用群组头潜在注意力(GLA)。这些变更相较于 NSA 可将 KV 缓存内存降低 50%,同时提升模型在常识推理和长文本理解方面的能力。实验在 340 百万至 13 亿参数模型上进行,训练数据为 150 亿至 1000 亿 token;结果表明,我们的方法在常识推理和长文本理解任务上与完整注意力和本机稀疏注意力相当或更优。
引用
@article{arxiv.2511.00819,
title = {Optimizing Native Sparse Attention with Latent Attention and Local Global Alternating Strategies},
author = {Yuxuan Hu and Jianchao Tan and Jiaqi Zhang and Wen Zan and Pingwei Sun and Yifan Lu and Yerui Sun and Yuchen Xie and Xunliang Cai and Jing Zhang},
journal= {arXiv preprint arXiv:2511.00819},
year = {2025}
}