中文

反向传播中的迷失:LM 头是梯度瓶颈

计算与语言 2026-03-12 v1

摘要

神经语言模型(LM)的最后一层将维数为 DD 的输出特征投影到维数为 VV(词汇表大小)的逻辑中,通常情况下 DVD \ll V。这一不匹配已知会引发神经 LM 表达受限的风险,形成所谓的 softmax 瓶颈。我们进一步表明,softmax 瓶颈不仅是表达瓶颈,更是优化瓶颈。对 VV 维梯度进行反向传播通过一个秩为 DD 的线性层会导致不可避免的压缩,这会改变为大多数参数提供的训练反馈。我们对这一现象进行了理论分析,并经验测量到 95-99% 的梯度范数被输出层抑制,导致极不优化的更新方向。我们进行受控的预训练实验,表明梯度瓶颈使平凡模式难以学习,并严重影响 LLM 的训练动力学。我们认为,这一固有的缺陷独立于模型架构, contributes to scale 上的训练效率低下,促使需要新的 LM 头设计。

关键词

引用

@article{arxiv.2603.10145,
  title  = {Lost in Backpropagation: The LM Head is a Gradient Bottleneck},
  author = {Nathan Godey and Yoav Artzi},
  journal= {arXiv preprint arXiv:2603.10145},
  year   = {2026}
}