中文

分析与减少 GPT 训练中学习率预热的需求

机器学习 2024-11-01 v1

摘要

学习率预热是一种训练神经网络的流行启发式方法,尤其是在较大批量大小下,尽管对其益处的理解有限。预热通过在训练早期使用较低的学习率 ηt\eta_t 来减小更新步长 Δwt=ηtut\Delta \mathbf{w}_t = \eta_t \mathbf{u}_t。在这项工作中,我们认为预热通过限制 Δwt\Delta \mathbf{w}_t 的整体大小来有益于训练,从而抵消 ut\mathbf{u}_t 较大的初始值。我们聚焦于使用 AdamW/Lion 的小规模 GPT 训练,探讨以下问题:为什么以及根据什么标准,早期更新 ut\mathbf{u}_t 会过大?我们分析了更新大小的不同度量,包括 2\ell_2-范数、导致的方向变化以及对网络表示的影响,为预热提供了新的视角。特别是,我们发现预热有助于抵消较大的角度更新以及训练早期有限的临界批量大小。最后,我们表明,通过修改优化器以根据上述度量显式归一化 ut\mathbf{u}_t,可以显著减少或消除对预热的需求。

关键词

引用

@article{arxiv.2410.23922,
  title  = {Analyzing & Reducing the Need for Learning Rate Warmup in GPT Training},
  author = {Atli Kosson and Bettina Messmer and Martin Jaggi},
  journal= {arXiv preprint arXiv:2410.23922},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024