学习少即是多:预mature 上层注意力专化损害语言模型预训练
计算与语言
2026-05-12 v1
摘要
因果解码块具有层级结构:下层构建残差基,供上层注意力参考。我们识别出 GPT 预训练中的一种失效模式:上层在下层特征稳定之前就过早地专化注意力模式。我们称之为 premature upper-layer attention specialization。暂时仅减缓上层 Q/K 投影的学习率,可在不改变其他参数的前提下提高最终困惑度和下游准确率,防止上层注意力对不成熟的残差基崩溃。在 LLaMA 结构块中,同样的干预几乎不需要。通过消融实验,我们将其归因于乘性门控前馈网络(而非 RMSNorm 或去偏置),其抑制了上游残差写入。一条路径分析统一了两者发现:学习率干预降低了步长因子,而门控前馈网络降低了相同的生长路径上的残差能量因子。我们的结果指出,上层 Q/K 时机是解码器架构与优化之间具体的交互点。
关键词
引用
@article{arxiv.2605.10504,
title = {Learning Less Is More: Premature Upper-Layer Attention Specialization Hurts Language Model Pretraining},
author = {Jinchang Zhu and Jindong Li and Yuwen Hao and Chengyu Zou and Rong Fu and Menglin Yang},
journal= {arXiv preprint arXiv:2605.10504},
year = {2026}
}