中文

解构语言模型良好优化器的要素

机器学习 2025-03-03 v2 人工智能

摘要

随着规模的增加,训练语言模型的成本日益增高,促使众多尝试提高优化效率。尽管如此,Adam 优化器仍是最广泛使用的,因其被视为最有效的方法。我们旨在比较多种优化算法,包括 SGD、Adafactor、Adam、Lion 和 Sophia,在自回归语言建模中进行评估,涵盖 various 模型规模、超参数和架构变体。我们的发现表明,除 SGD 外,这些算法在其最优性能和在广泛超参数选择下的表现都相当。我们的结果表明,实践者可以依据实际考虑如内存限制和实现便利性来选择优化器,因没有算法在性能或对超参数误用稳定性方面明显占优。鉴于我们的发现,我们进一步剖析了这些方法,检查了 Adam 的两种简化版本:a) 符号动量 (Signum),我们看到它恢复了 Adam 的性能和超参数稳定性;b) Adalayer,是 Adam 的层级变体,我们引入以研究 Adam 对网络不同层的预条件化影响。检查 Adalayer 导致我们得出结论,或许出乎意料的是,Adam 在最后一层以及 LayerNorm 参数的适应性对于保持性能和对学习率的稳定性至关重要。

关键词

引用

@article{arxiv.2407.07972,
  title  = {Deconstructing What Makes a Good Optimizer for Language Models},
  author = {Rosie Zhao and Depen Morwani and David Brandfonbrener and Nikhil Vyas and Sham Kakade},
  journal= {arXiv preprint arXiv:2407.07972},
  year   = {2025}
}

备注

21 pages, ICLR 2025