中文

带学习率退火的比例尺定律

计算与语言 2024-10-28 v2 人工智能 机器学习

摘要

我们发现,神经语言模型的交叉熵损失曲线在训练步骤上服从学习率(LR)退火的比例尺定律:L(s)=L0+AS1αCS2,L(s) = L_0 + A\cdot S_1^{-\alpha} - C\cdot S_2, 其中 L(s)L(s) 为第 ss 步的验证损失,S1S_1 为 LR 曲线下的面积,S2S_2 为 LR 退火面积,L0L_0AACCα\alpha 为常数参数。该公式考虑了两个因素:(1)数据规模的幂律比例尺,(2)LR 退火期间的额外损失减少。因此,该公式能够描述每个步骤的完整损失曲线,而不仅仅是训练结束时单个损失点。应用带 LR 退火的比例尺定律并仅拟合一条或两条训练曲线,即可准确预测任意学习率调度器(LRS)下任意步骤的损失。这一方法显著降低了制定比例尺定律的计算成本,同时为训练动态提供更高的准确性和表达力。广泛实验表明,我们的发现在各种超参数和模型架构上都成立,且该方程可扩展至模型规模的比例尺效应。此外,我们的公式为大量前人研究的经验结果提供了准确的理论验证与解释,尤其是那些关注 LR 调度和退火的研究。我们相信,这项工作有前景,可增进对大语言模型训练动态的理解,同时大幅降低比例尺定律的民主化程度,并可指导研究人员进一步优化训练策略(例如关键 LRS)。

关键词

引用

@article{arxiv.2408.11029,
  title  = {Scaling Law with Learning Rate Annealing},
  author = {Howe Tissue and Venus Wang and Lu Wang},
  journal= {arXiv preprint arXiv:2408.11029},
  year   = {2024}
}

备注

Add more experiments to consolidate our scaling laws. 29 pages, 29 figures