中文

CLAA:加速 LLM 预填充的跨层注意力聚合

计算与语言 2026-02-19 v1 机器学习

摘要

长上下文 LLM 推理中的预填充阶段仍然是计算瓶颈。最近的 token 排序启发式方法通过有选择地处理子语义相关 token 来加速推理。然而,现有方法 suffer from 稳定性差的 token 重要性估计,往往在不同层之间变化。在评估 token 排序质量独立于启发式特定架构的情况下,识别其差异是一个挑战。为此,我们引入了 Answer-Informed Oracle,通过测量生成答案回到提示的注意力来定义 ground-truth token 重要性。该 oracle 揭示了现有启发式方法在不同层之间存在高方差:排名在特定层可能急剧下降,这种失效模式在端到端基准测试中难以察觉。诊断表明,一个简单解决方案是而不是依赖单个层:跨层聚合得分。我们将其实现为 Cross-Layer Attention Aggregation (CLAA),它接近 oracle 上限,较 Full KV Cache 基线将 Time-to-First-Token (TTFT) 降低最高 39%。

关键词

引用

@article{arxiv.2602.16054,
  title  = {CLAA: Cross-Layer Attention Aggregation for Accelerating LLM Prefill},
  author = {Bradley McDanel and Steven Li and Harshit Khaitan},
  journal= {arXiv preprint arXiv:2602.16054},
  year   = {2026}
}

备注

15 pages, 8 figures