中文

当注意力崩溃时:LLM中的退化层如何实现更小更强的模型

计算与语言 2026-02-17 v4 人工智能 机器学习

摘要

大型语言模型(LLM)以其性能著称,但我们发现了一个显著的结构性低效现象:我们称之为注意力崩溃。在许多预训练的decoder风格LLM中,深层注意力矩阵退化,坍缩为近乎秩一的结构。这些未被充分利用的层,我们称之为懒惰层,是冗余的并损害了模型效率。为了解决这个问题,我们引入了Inheritune,一种简单而强大的训练方案,旨在构建更小、更强的语言模型。Inheritune通过从较大的预训练模型中继承强大的早期层来初始化一个紧凑模型,然后逐步训练和扩展它。我们在包括GPT-2系列在内的各种模型上的实验表明,使用Inheritune训练的模型尽管层数显著减少,但可以匹配甚至超越其更大对应模型的性能。这项工作提供了一条通过设计实现模型压缩的新路径,使得创建紧凑但高性能的语言模型成为可能。代码可在https://github.com/sanyalsunny111/LLM-Inheritune获取。

关键词

引用

@article{arxiv.2404.08634,
  title  = {When Attention Collapses: How Degenerate Layers in LLMs Enable Smaller, Stronger Models},
  author = {Sunny Sanyal and Ravid Shwartz-Ziv and Alexandros G. Dimakis and Sujay Sanghavi},
  journal= {arXiv preprint arXiv:2404.08634},
  year   = {2026}
}

备注

Published in Transactions on Machine Learning Research (TMLR)