GradientStabilizer:固定范数,而非梯度
机器学习
2026-05-28 v4 人工智能
摘要
现代深度学习系统中的训练不稳定性通常由罕见但极端的梯度范数突增引发,这会导致过大的参数更新、破坏优化器状态,并导致恢复缓慢或发散。诸如梯度裁剪等广泛使用的防护措施可以缓解这些失败,但需要调整阈值,并且会无差别地截断大的更新。我们提出了 GradientStabilizer,这是一种轻量级的即插即用型梯度变换,它保留瞬时梯度方向,同时用从运行梯度范数统计中导出的统计稳定估计来替换更新幅度。我们证明了在突进步骤中,所得的稳定幅度是均匀有界的,且与突增大小无关,并展示了这种有界性如何在自适应方法中控制优化器状态的演化。在 LLM 预训练 (FP16)、量化感知预训练 (FP4)、ImageNet 分类、强化学习和时间序列预测中,GradientStabilizer 始终如一地提高了训练稳定性,拓宽了稳定学习率区域,并相对于基于裁剪的基线减少了发散,甚至大幅降低了 Adam 对权重衰减强度的敏感性。代码即将发布。
引用
@article{arxiv.2502.17055,
title = {GradientStabilizer:Fix the Norm, Not the Gradient},
author = {Tianjin Huang and Zhangyang Wang and Haotian Hu and Zhenyu Zhang and Gaojie Jin and Xiang Li and Li Shen and Jiaxing Shang and Tianlong Chen and Ke Li and Lu Liu and Qingsong Wen and Shiwei Liu},
journal= {arXiv preprint arXiv:2502.17055},
year = {2026}
}
备注
Accepted By ICML2026