Conda:用于加速大型语言模型训练的列归一化Adam
机器学习
2025-10-01 v2 人工智能
摘要
大型语言模型(LLM)已展示出惊人的概括和涌现能力,但其预训练仍昂贵且对优化动力学敏感。尽管Adam等基于Adam的优化器通过坐标适应性学习率实现快速收敛,但最近的研究表明其更新常常受到较差的谱条件和低秩结构的制约,阻碍了效率。Muon通过全局谱归一化解决了此问题,但缺乏Adam的逐坐标适应性。在本工作中,我们提出了Column-Normalized Adam(Conda),一种新型优化器,连接了两种方法的优势。Conda将更新投影到正交子空间,并基于投影梯度应用列式二阶矩归一化,从而实现改进的谱条件和保持坐标适应性。该设计缓解了Adam的谱病理问题,同时保留了其快速收敛行为。在LLaMA和GPT-2系列上的大量实验表明,Conda在预训练中一致优于AdamW、Muon和其他基线。令人惊讶的是,在LLaMA系列上,Conda的收敛速度达到AdamW的2-2.5倍,测量标准为训练步骤和训练时间。进一步的消融实验表明其在多种训练设置下具有稳健性。这些结果共同凸显了Conda作为大规模LLM训练中有效且广泛适用的优化器。我们的代码已在https://github.com/jie040109/Conda上发布。
引用
@article{arxiv.2509.24218,
title = {Conda: Column-Normalized Adam for Training Large Language Models Faster},
author = {Junjie Wang and Pan Zhou and Yiming Dong and Huan Li and Jia Li and Xun Zhou and Qicheng Lao and Cong Fang and Zhouchen Lin},
journal= {arXiv preprint arXiv:2509.24218},
year = {2025}
}