反向传播中的迷失:LM 头是梯度瓶颈
计算与语言
2026-03-12 v1
摘要
神经语言模型(LM)的最后一层将维数为 的输出特征投影到维数为 (词汇表大小)的逻辑中,通常情况下 。这一不匹配已知会引发神经 LM 表达受限的风险,形成所谓的 softmax 瓶颈。我们进一步表明,softmax 瓶颈不仅是表达瓶颈,更是优化瓶颈。对 维梯度进行反向传播通过一个秩为 的线性层会导致不可避免的压缩,这会改变为大多数参数提供的训练反馈。我们对这一现象进行了理论分析,并经验测量到 95-99% 的梯度范数被输出层抑制,导致极不优化的更新方向。我们进行受控的预训练实验,表明梯度瓶颈使平凡模式难以学习,并严重影响 LLM 的训练动力学。我们认为,这一固有的缺陷独立于模型架构, contributes to scale 上的训练效率低下,促使需要新的 LM 头设计。
引用
@article{arxiv.2603.10145,
title = {Lost in Backpropagation: The LM Head is a Gradient Bottleneck},
author = {Nathan Godey and Yoav Artzi},
journal= {arXiv preprint arXiv:2603.10145},
year = {2026}
}