GPAS:通过梯度保持激活缩放加速LLM预训练收敛
机器学习
2025-07-04 v2 计算与语言
摘要
现代大型语言模型(如LLaMA、Qwen和DeepSeek系列)主要采用Pre-LayerNorm(Pre-LN)Transformer架构。虽然该架构在预训练期间稳定性好且可扩展至大模型规模,但Pre-LN存在激活方差在层间的指数级增长,导致残差连接中的shortcut主导于子层输出,限制了深层的学习能力。为此,我们提出梯度保持激活缩放(Gradient-Preserving Activation Scaling, GPAS)——一种可与现有方法结合使用的简单技术。GPAS通过缩小中间激活的尺度但保持其梯度不变来实现工作。这种做法保留了激活中的信息,避免了梯度缩小导致的梯度消失问题。我们在从71M到1B various model sizes的模型上进行大量实验,证明GPAS能实现持续的性能提升。除了增强Pre-LN Transformer,GPAS还显示出改进Sandwich-LN和DeepNorm等替代架构的潜力,展示了其在广泛场景下提升训练动力学的通用性。我们的代码已公开:https://github.com/dandingsky/GPAS。
关键词
引用
@article{arxiv.2506.22049,
title = {GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling},
author = {Tianhao Chen and Xin Xu and Zijing Liu and Pengxiang Li and Xinyuan Song and Ajay Kumar Jaiswal and Fan Zhang and Jishan Hu and Yang Wang and Hao Chen and Shizhe Diao and Shiwei Liu and Yu Li and Lu Yin and Can Yang},
journal= {arXiv preprint arXiv:2506.22049},
year = {2025}
}