中文

原生Top-$k$稀疏注意力的前景与挑战初步研究

计算与语言 2025-12-04 v1 机器学习

摘要

大语言模型(LLMs)在长上下文建模领域日益普及,然而其推理计算成本已成为阻碍智能体(agents)和多模态应用等任务进展的关键瓶颈。本报告对Top-kk注意力机制在解码和训练两个阶段的有效性和理论机制进行了初步研究。首先,我们通过大量实验验证了精确Top-kk解码的有效性。实验表明,在解码阶段仅保留与查询相似度最高的关键键(Keys)作为上下文窗口,在HELMET和LongBench v2等下游任务上可以达到与全注意力相当甚至超越的性能。其次,我们进一步探索了原生Top-kk注意力训练策略。实验证实,确保训练与推理阶段Top-kk注意力操作的一致性有助于进一步释放Top-kk解码的潜力,从而显著提升模型性能。此外,考虑到精确Top-kk注意力的高计算复杂度,我们研究了近似Top-kk算法精度对下游任务的影响。我们的研究证实了下游任务性能与近似保真度之间的正相关关系,并提供了DeepSeek-V3.2-Exp模型中Lightning Indexer精度的统计评估。最后,本报告从熵的角度提供了理论解释。实验观察表明,接受Top-kk注意力SFT的模型在下游任务中表现出明显的熵减现象,这验证了低熵状态更适应Top-kk解码的假设。

关键词

引用

@article{arxiv.2512.03494,
  title  = {A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention},
  author = {Di Xiu and Hongyin Tang and Bolin Rong and Lizhi Yan and Jingang Wang and Yifan Lu and Xunliang Cai},
  journal= {arXiv preprint arXiv:2512.03494},
  year   = {2025}
}