中文

大型语言模型中的垃圾注意力:BOS sink 头及感知式修剪

计算与语言 2026-01-13 v1

摘要

大型语言模型 (LLM) 已知包含显著冗余性,但对于为何某些组件(尤其是更高层)更具冗余性的系统性解释一直未能提供。本文我们识别到了 BOS sink 现象作为驱动这种层级敏感性的关键机制。我们表明,具有高 BOS sink 分数的注意力头与功能冗余性强相关:此类注意力头(尤其在更深的层中)对预测性能贡献甚微,实际上充当了“多余注意力权重的 dumping ground”。这为先前研究中报告的结构性冗余提供了具体的功能解释。基于这一洞察,我们引入一种简单的方法,通过移除高 BOS sink 注意力头来实现修剪。实验在 Gemma-3、Llama-3.1 和 Qwen3 上均表明,这种方法比基于权重或激活的标准准则更可靠地识别冗余的 transformer 组件,同时即使在激进修剪下也能保持接近稠密基线的性能。此外,我们发现 sink 头的行为在不同的序列长度下保持稳定。总体而言,我们的结果表明,注意力的结构属性为模型压缩提供了更直观且更稳健的基础,优于基于幅值的传统方法。

关键词

引用

@article{arxiv.2601.06787,
  title  = {Garbage Attention in Large Language Models: BOS Sink Heads and Sink-aware Pruning},
  author = {Jaewon Sok and Jewon Yeom and Seonghyeon Park and Jeongjae Park and Taesup Kim},
  journal= {arXiv preprint arXiv:2601.06787},
  year   = {2026}
}