AdamS:动量本身可作为 LLM 预训练和后训练的归一化器
机器学习
2025-05-23 v1 人工智能
机器学习
摘要
我们提出 AdamS,这是一种简单而有效的 Adam 算法替代方案,用于大语言模型 (LLM) 的预训练和后训练。通过采用 novel denominator——即动量与当前梯度平方和的加权求和之根,AdamS 消除了对二阶矩估计的需求。因此,AdamS 在内存和计算资源方面与 SGD with momentum 相当,同时展现出优越的优化性能。此外,AdamS 使用便捷:它可以直接继承 AdamW 的超参数,完全模型无关,无需修改优化器 API 或架构即可无缝集成到现有管道中。AdamS 的动机源于对 transformer 目标函数中 (L_0, L_1) 平滑性的观察,其中局部平滑性由梯度大小控制,可进一步近似为动量大小。我们提供严格的理论收敛保证,并给出实际的超参数选择指南。实验表明,AdamS 在 various tasks 中表现优异,包括在 GPT-2 和 Llama2(最高达 13B 参数)上的预训练运行以及后训练中的强化学习。凭借其效率、简单性和理论依据,AdamS 是现有优化器值得采纳的有力替代方案。
引用
@article{arxiv.2505.16363,
title = {AdamS: Momentum Itself Can Be A Normalizer for LLM Pretraining and Post-training},
author = {Huishuai Zhang and Bohan Wang and Luoxin Chen},
journal= {arXiv preprint arXiv:2505.16363},
year = {2025}
}