识别与评估预训练 LLM 中的非活跃注意力头
机器学习
2026-03-03 v4
摘要
注意力机制是大语言模型(LLM)的基础,它使不同的注意力头能够对相关输入词元进行多样化聚焦。然而,诸如注意力汇聚(attention sinks)之类的习得行为——即首个词元尽管语义重要性有限却获得最多注意力——表明某些注意力头可能处于非活跃状态,并指向一个显著的计算冗余来源。为分析这一现象,我们评估了 12 种衡量注意力头不同非活跃方式的评分函数。对这些评分设定阈值,使我们能够分析不同的潜在非活跃注意力头集合。我们通过模型干预来评估所识别出的注意力头是否确实非活跃,发现平均而言超过 12% 的注意力头是非活跃的,并且可在特定情境下被剪枝,同时将 MMLU 准确率维持在预训练 LLM 的 1% 误差范围内。跨 3 个模型家族,我们衡量注意力头输出平均范数的评分函数,能够一致地识别出仅依赖注意力权重评分的函数所无法发现的非活跃头。我们证实,依赖衡量首个词元注意力汇聚的评分函数会低估非活跃头的普遍程度,平均会遗漏超过 7% 的非活跃头。我们还展示了如何通过衡量评分分布来洞察注意力行为。例如,我们发现微调几乎不会改变注意力行为,并且即使在同一模型家族内,大模型规模也呈现出不同的注意力行为。
引用
@article{arxiv.2504.03889,
title = {Identifying and Evaluating Inactive Heads in Pretrained LLMs},
author = {Pedro Sandoval-Segura and Xijun Wang and Ashwinee Panda and Micah Goldblum and Ronen Basri and Tom Goldstein and David Jacobs},
journal= {arXiv preprint arXiv:2504.03889},
year = {2026}
}
备注
Accepted to ICLR 2026. Code available at https://github.com/psandovalsegura/inactive-heads