我们真的需要Adam吗?在LLM强化学习中使用SGD实现惊人的强大与稀疏性
机器学习
2026-02-25 v2 人工智能
摘要
强化学习(RL),特别是RL从可验证奖励(RLVR),已成为训练大型语言模型(LLMs)的关键阶段,是当前规模化努力的焦点。然而,RL的优化实践仍遵循下一标记预测阶段(如预训练和监督微调)的做法,尽管近期研究已指出RL与这些阶段存在根本差异。其中一种做法是使用AdamW优化器,而AdamW在训练大型transformer模型时广受采用,尽管其内存开销较大。我们的分析表明,AdamW中的动量和自适应学习率在RL中的影响小于在SFT中,从而我们推断RL从Adam式的 per 参数自适应学习率和动量方面获益较小。确认了这一假设后,我们的实验表明,显著更高效的SGD——在大型transformer模型的监督学习中表现较差——在LLM的RL中可与甚至优于AdamW。令人惊讶的是,仅使用SGD进行完整微调,即可更新不到0.02%的模型参数,且无需任何稀疏性正则化,这比AdamW多出了1000倍。我们的分析提供了这种稀疏性的潜在原因。这些发现为RL在LLMs上的优化动力学提供了新见解,表明RL在参数效率方面显著优于人们先前所认识的程度。
引用
@article{arxiv.2602.07729,
title = {Do We Need Adam? Surprisingly Strong and Sparse Reinforcement Learning with SGD in LLMs},
author = {Sagnik Mukherjee and Lifan Yuan and Pavan Jayasinha and Dilek Hakkani-Tür and Hao Peng},
journal= {arXiv preprint arXiv:2602.07729},
year = {2026}
}