谨慎优化器:通过一行代码提升训练效果
机器学习
2026-02-17 v4 人工智能
计算与语言
计算机视觉与模式识别
离散数学
摘要
AdamW一直是transformer预训练的默认优化器。多年来,我们的社区一直在寻找更快更稳定的优化器,但仅获得受限的正面结果。在本工作中,我们提出了一种对任何基于动量的优化器进行修改的“一行代码”方法,我们将其命名为谨慎优化器,例如C-AdamW和C-Lion。我们的理论结果表明,这种修改保留了Adam的哈密顿函数,且在Lyapunov分析下不会破坏收敛保证。此外,我们的理论洞察揭示了一整套新的优化器家族。其中,我们选取最简单的一种进行经验实验,结果显示不仅在LLM预训练中实现了一致的加速,还在图像分类任务中表现出色,且对超参数的额外调优要求最低。代码已公开于https://github.com/kyleliang919/C-Optim。
引用
@article{arxiv.2411.16085,
title = {Cautious Optimizers: Improving Training with One Line of Code},
author = {Kaizhao Liang and Lizhang Chen and Bo Liu and Qiang Liu},
journal= {arXiv preprint arXiv:2411.16085},
year = {2026}
}