中文

学习少即是多:预mature 上层注意力专化损害语言模型预训练

计算与语言 2026-05-12 v1

摘要

因果解码块具有层级结构:下层构建残差基,供上层注意力参考。我们识别出 GPT 预训练中的一种失效模式:上层在下层特征稳定之前就过早地专化注意力模式。我们称之为 premature upper-layer attention specialization。暂时仅减缓上层 Q/K 投影的学习率,可在不改变其他参数的前提下提高最终困惑度和下游准确率,防止上层注意力对不成熟的残差基崩溃。在 LLaMA 结构块中,同样的干预几乎不需要。通过消融实验,我们将其归因于乘性门控前馈网络(而非 RMSNorm 或去偏置),其抑制了上游残差写入。一条路径分析统一了两者发现:学习率干预降低了步长因子,而门控前馈网络降低了相同的生长路径上的残差能量因子。我们的结果指出,上层 Q/K 时机是解码器架构与优化之间具体的交互点。

关键词

引用

@article{arxiv.2605.10504,
  title  = {Learning Less Is More: Premature Upper-Layer Attention Specialization Hurts Language Model Pretraining},
  author = {Jinchang Zhu and Jindong Li and Yuwen Hao and Chengyu Zou and Rong Fu and Menglin Yang},
  journal= {arXiv preprint arXiv:2605.10504},
  year   = {2026}
}