中文

重型尾部引导的层级学习率适用于大型语言模型(LLMs)

机器学习 2026-05-28 v3 人工智能

摘要

学习率配置是现代深度学习的基本方面。将统一学习率应用于所有层的做法忽略了 Transformer 的结构异质性,可能限制其作为大型语言模型(LLM) backbone 的效果。本文引入层级学习率(LLR),这是一种为单个 Transformer 层分配不同学习率的自适应方案。该方法基于重尾自正则化(Heavy-Tailed Self-Regularization, HT-SR)理论,对权重相关矩阵的经验谱密度(ESD)进行建模,以量化重尾程度。对重尾程度较弱的层分配较大的学习率以加速训练,对重尾程度较强的层分配较小的学习率。通过按此方式调整学习率,LLR 在各层之间促进更平衡的训练,从而实现更快的收敛并提高泛化性能。跨越从 LLaMA 到 GPT-nano 的各种架构、包括 AdamW 和 Muon 的优化器,以及从 60M 到 3B 参数的模型规模,使用最多 1000 亿训练标记的广泛实验表明 LLR 的有效性。LLR 实现了最高可达 1.5 倍的训练加速,并持续优于统一学习率基线。特别是,它将 1B 模型的平均零样本准确率从 47.09% 提升至 49.02%,将 3B 模型的平均零样本准确率从 48.58% 提升至 50.61%。LLR 的一个关键优势是调低开销低:它可以将几乎最优的学习率设置直接从统一基线迁移。代码已公开于 https://github.com/hed-ucas/Layer-wise-Learning-Rate。

关键词

引用

@article{arxiv.2605.22297,
  title  = {One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs},
  author = {Di He and Songjun Tu and Keyu Wang and Lu Yin and Shiwei Liu},
  journal= {arXiv preprint arXiv:2605.22297},
  year   = {2026}
}