中文

直达零:线性衰减学习率为何在 LLM 训练中效果最佳

机器学习 2025-11-25 v2 人工智能 计算与语言 神经与进化计算

摘要

LLM 通常采用学习率 (LR) 预热,然后余弦衰减至最大值的 10% (10 倍衰减)。在大规模实证研究中,我们展示,在计算最优数据集大小下,简单线性衰减至零 (D2Z) 计划在训练时始终优于其他计划。D2Z 在 various model sizes、batch sizes、datasets 和 vocabularies 之间表现出色,随着数据集大小增加,优势也随之增大。利用对 AdamW 的新颖解释,将其视为权重更新的指数移动平均,我们展示线性 D2Z 如何在平衡早期训练(远离初始条件)和晚期训练(为缓解梯度噪声而对更多更新进行平均)方面发挥最佳作用。在实验中,使用 D2Z 对 610M 参数模型进行 80 tokens-per-parameter (TPP) 的训练,可获得低于使用 10 倍衰减进行 200 TPP 训练的损失,相当于惊人的 60% 计算节省。诸如 Llama2-7B 之类的模型,若在 286 TPP 使用 10 倍衰减训练,可能通过使用 D2Z 节省大部分计算资源。

关键词

引用

@article{arxiv.2502.15938,
  title  = {Straight to Zero: Why Linearly Decaying the Learning Rate to Zero Works Best for LLMs},
  author = {Shane Bergsma and Nolan Dey and Gurpreet Gosal and Gavia Gray and Daria Soboleva and Joel Hestness},
  journal= {arXiv preprint arXiv:2502.15938},
  year   = {2025}
}

备注

ICLR 2025