中文

LayerBoost:面向高效 LLM 的层级感知注意力降低方法

机器学习 2026-05-15 v2 计算与语言

摘要

Transformer 模型主要依赖 softmax 注意力机制,其随序列长度呈二次复杂度,仍是高效推理的主要瓶颈。先前的线性或混合注意力方法通常在所有层上统一替换 softmax 注意力,导致显著性能下降或需要 extensive 重新训练以恢复模型质量。本工作提出 LayerBoost,一种基于单个Transformer层灵敏度的层级感知注意力降低方法。它首先对预训练模型进行系统性灵敏度分析,以识别对维持性能至关重要的层。基于此分析,可应用三种不同策略:在高度灵敏层保留标准 softmax 注意力、在中等灵敏度层替换为线性滑动窗口注意力、在低灵敏度层完全移除注意力。为在这些架构修改后恢复性能,我们引入一种轻量级基于蒸馏的修复阶段,仅需 10M 个额外训练标记。LayerBoost 在高并发场景下可将推理延迟降低最高 68%,提升吞吐量,同时保持竞争的模型质量。它在多个基准上与基础模型持平,在其他基准上仅出现轻微退化,显著优于最先进的注意力线性化方法。这些效率提升使其特别适用于高并发服务和硬件受限的部署场景,其中推理成本和内存占用是关键瓶颈。

关键词

引用

@article{arxiv.2604.22050,
  title  = {LayerBoost: Layer-Aware Attention Reduction for Efficient LLMs},
  author = {Mohamed Ali Souibgui and Jan Fostier and Rodrigo Abadía-Heredia and Bohdan Denysenko and Christian Marschke and Igor Peric},
  journal= {arXiv preprint arXiv:2604.22050},
  year   = {2026}
}