在预算有限的情况下为 LLM 进行预训练:三种优化器的比较
机器学习
2025-07-23 v2 人工智能
摘要
优化器在减少 LLM 预训练时间和实现更佳模型方面发挥决定性作用。本研究比较了三种主要变体:事实上的标准 AdamW、通过演化搜索开发的较简单 Lion 以及二阶优化器 Sophia。为获得更好的泛化能力,我们使用两种不同的基础架构,并在保持 token 数不变的条件下采用单阶段和多阶段方法。通过采用最大更新参数化方法和较小的代理模型,我们分别针对每种基础架构和优化器组合调整相关超参数。我们发现,尽管三种优化器的结果大致在相同的范围内,Sophia 在训练和验证损失方面最低,Lion 在训练 GPU 小时方面最快,但 AdamW 带来了最佳的下游评估结果。
引用
@article{arxiv.2507.08472,
title = {Pre-Training LLMs on a budget: A comparison of three optimizers},
author = {Joel Schlotthauer and Christian Kroos and Chris Hinze and Viktor Hangya and Luzian Hahn and Fabian Küch},
journal= {arXiv preprint arXiv:2507.08472},
year = {2025}
}