AdaGC:改善大语言模型预训练的训练稳定性
机器学习
2026-02-24 v2
摘要
损失尖峰仍然是大规模语言模型预训练中一个持续的障碍。虽然先前研究试图通过考察单个因素来识别损失尖峰的根源,但我们观察到,在实践中,此类尖峰通常由多种异质因素的共同触发而引起。经验上,损失尖峰可能源于数据异常值、硬件或瞬时计算故障、数值精度问题以及超参数设置的组合。无论底层原因如何,这些尖峰都表现为不稳定的优化器更新,因为异常梯度同时污染了一阶和二阶矩状态。在本文中,我们提出了一种以梯度为中心的原则性补救方法:AdaGC,一种自适应逐张量梯度裁剪方案,通过将梯度范数相对于其历史裁剪值的逐张量指数移动平均进行约束,来缓解此类污染。AdaGC与优化器无关,引入的内存开销可忽略不计,并且与GlobalGC相比降低了通信成本,特别是在混合并行的分布式训练环境中。在Llama-2 7B、Mixtral 8x1B和ERNIE 10B-A1.4B上的实验表明,AdaGC稳健地消除了训练不稳定性,对所有模型一致地将尖峰分数降至零,并相比GlobalGC分别将下游准确率提高了1.32%、1.27%和2.48%。此外,AdaGC与Muon和Lion等优化器无缝集成,始终产生更高的平均准确率和零尖峰分数。
引用
@article{arxiv.2502.11034,
title = {AdaGC: Improving Training Stability for Large Language Model Pretraining},
author = {Guoxia Wang and Shuai Li and Congliang Chen and Jinle Zeng and Jiabin Yang and Dianhai Yu and Yanjun Ma and Li Shen},
journal= {arXiv preprint arXiv:2502.11034},
year = {2026}
}