学习率调度方案下损失曲线的多幂律预测
机器学习
2025-03-18 v1 人工智能
计算与语言
机器学习
摘要
大规模模型训练既资源密集又耗时,因此理解模型性能与超参数之间的定量关系至关重要。本文提出了一种经验法则,描述大型语言模型在不同学习率调度方案(如常数、余弦和阶梯衰减方案)下的预训练损失如何演化。我们提出的法则采用多幂律形式,结合基于学习率之和的幂律以及额外的幂律,以 accounts for 由学习率衰减引起的损失减少效应。我们在各种模型规模和架构上广泛验证该法则,并表明在拟合几个学习率调度方案后,该法则能够准确预测不同形状和时域的未见过的调度方案的损失曲线。此外,通过最小化跨学习率调度方案的预测最终预训练损失,我们能够发现一种超越广泛使用的余弦学习率调度方案的调度方法。有趣的是,这种自动发现的调度方案与最近提出的Warmup-Stable-Decay(WSD)调度方案(Hu等,2024)具有某些相似性,但实现略低的最终损失。我们认为这些结果为理解预训练动力学及设计提高效率的学习率调度方案提供了宝贵的见解。
引用
@article{arxiv.2503.12811,
title = {A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules},
author = {Kairong Luo and Haodong Wen and Shengding Hu and Zhenbo Sun and Zhiyuan Liu and Maosong Sun and Kaifeng Lyu and Wenguang Chen},
journal= {arXiv preprint arXiv:2503.12811},
year = {2025}
}