中文

GradPower:加速语言模型预训练的梯度功率化技术

机器学习 2026-05-21 v3 最优化与控制 机器学习

摘要

我们提出了GradPower,这是一种轻量级的梯度转换技术,用于加速语言模型预训练。给定梯度向量 g=(gi)ig=(g_i)_i,GradPower 首先应用元素级幂运算变换:φp(g)=(sign(gi)gip)i\varphi_p(g)=({\rm sign}(g_i)|g_i|^p)_{i},其中 p>0p>0 为固定参数,然后将变换后的梯度输入到基本优化器中。值得注意的是,GradPower 只需一行代码的修改,且无需修改基本优化器的内部逻辑,包括超参数。当应用于 Adam(称为 AdamPower)时,GradPower 在 diverse architectures(LLaMA、Qwen2MoE)、parameter scales(66M 到 2B)、datasets(C4、OpenWebText)以及 learning-rate schedules(cosine、warmup-stable-decay)中均可获得更低的终端损失。对现代 mixture-of-experts 模型进行 warmup-stable-decay 训练时,GradPower 的提升尤为显著。GradPower 还能无缝集成到其他前沿优化器(如 Muon),进一步提升性能。最后,我们提供了理论分析,揭示了 GradPower 的底层机制,并突显了梯度噪声的影响。

关键词

引用

@article{arxiv.2505.24275,
  title  = {GradPower: Powering Gradients for Faster Language Model Pre-Training},
  author = {Jinbo Wang and Mingze Wang and Jiaqi Zhang and Wei Wang and Peng Pei and Xunliang Cai and Weinan E and Lei Wu},
  journal= {arXiv preprint arXiv:2505.24275},
  year   = {2026}
}

备注

24 pages, accepted by ICML 2026