中文

HyLRA:用于高效长上下文推理的混合层复用注意力机制

计算与语言 2026-02-03 v1

摘要

大型语言模型 (LLM) 的长上下文推理受限于注意力机制的二次计算复杂度以及 Key-Value (KV) 缓存的巨大内存占用。虽然现有稀疏注意力机制试图通过利用内在稀疏性来缓解此问题,但往往依赖刚性模式或激进剪枝,难以在效率与准确性之间实现最佳平衡。本文引入一种新型框架——HyLRA (Hybr id Layer Reuse Attention),驱动于层级稀疏性轮廓。我们的实证分析揭示注意力机制的双重特征:层内灵敏性,即特定层需要完整注意力以防止特征失真;层间相似性,即相邻层共享大量关键 token。基于这些观察,HyLRA 采用离线动态规划方法推导最优的层级策略。这种混合策略保留敏感层的完整注意力以确保鲁棒性,同时允许容忍层通过直接复用前一层的 top-k 索引来规避二次计算。该方法使 LLM 能限定在最关键的 token 上进行计算,有效克服稠密注意力的二次瓶颈。广泛的评估表明,HyLRA 在保持可比性能(<1% 准确性下降)的同时,将推理吞吐量提升 6%--46%,持续领先于最先进的稀疏注意力方法。HyLRA 已开源于 \href{https://anonymous.4open.science/r/unified-cache-management-CF80/}{\texttt{/r/unified-cache-management-CF80/}}。

关键词

引用

@article{arxiv.2602.00777,
  title  = {HyLRA: Hybrid Layer Reuse Attention for Efficient Long-Context Inference},
  author = {Xuan Ai and Qingqing Yang and Peng Wang and Lei Deng and Lin Zhang and Renhai Chen and Gong Zhang},
  journal= {arXiv preprint arXiv:2602.00777},
  year   = {2026}
}