中文

DELTA:用于高效长上下文推理的动态分层感知Token注意力

计算与语言 2026-05-05 v2 机器学习

摘要

大型推理模型(LRMs)通过生成长链中间步骤在挑战性基准测试上实现了最先进的性能,但其推理成本在解码阶段占主导地位,其中每个新token都必须注意整个不断增长的序列。一种减少此延迟的方法是驱逐键值(KV)缓存中的条目,从而减少注意力计算中使用的活动上下文。然而,这类稀疏注意力方法由于累积选择错误以及在长期推导中不断变化的token重要性,在推理任务上会出现严重的精度下降。我们提出\textbf{DELTA},一种无需训练的稀疏注意力机制,在不牺牲模型精度的前提下提高计算效率。DELTA将Transformer层分为三组:初始层使用完整注意力,一小部分\emph{Δ\Delta-层}通过聚合的头级注意力得分识别关键token,随后是仅注意所选子集的稀疏注意力层。这一设计保留了GPU内存中用于精度的完整KV缓存,同时避免了对大量层执行昂贵的完整注意力计算。在AIME和GPQA-Diamond等推理基准测试上,DELTA在精度上与完整注意力相当或更好,同时将被注意token数量降低最高可达4.25×4.25\times,实现端到端加速1.54×1.54\times。我们的结果表明,选择性重用中间注意力图为高效长上下文推理提供了稳健的路径。代码可在 https://github.com/hoenza/DELTA 获取。

关键词

引用

@article{arxiv.2510.09883,
  title  = {DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning},
  author = {Hossein Entezari Zarch and Lei Gao and Chaoyi Jiang and Murali Annavaram},
  journal= {arXiv preprint arXiv:2510.09883},
  year   = {2026}
}

备注

Accepted to Findings of ACL 2026