噪声自适应分层学习率:加速深度神经网络训练的几何感知优化
机器学习
2026-02-04 v2
摘要
几何感知优化算法(如 Muon)在深度神经网络训练中取得了显著成功。这些方法利用 DNN 的内在几何,通过为不同层选择 appropriate norm 并通过范数受限线性最小化算子 (LMO) 更新参数。然而,在同一规范组内的层之间及其训练过程中的局部曲率仍具有异质性。例如,最新研究表明,锐度在 transformer 各层及训练过程中差异巨大,但标准几何感知优化器对同一组内的层施加固定学习率,这在 DNN 训练中可能效率不高。本文在几何感知优化算法之上引入噪声自适应分层学习率方案,并显著加快 DNN 训练速度,优于使用固定学习率的方法。我们的算法在所选 LMO 激活的范数中实时估计梯度方差,并据此在每个组内分配时变噪声自适应分层学习率。我们提供理论分析,表明本算法实现尖锐收敛率。在 transformer 架构(如 LLaMA 和 GPT)上的实验结果表明,我们的方法在收敛速度上优于最先进的优化器。
引用
@article{arxiv.2510.14009,
title = {Noise-Adaptive Layerwise Learning Rates: Accelerating Geometry-Aware Optimization for Deep Neural Network Training},
author = {Jie Hao and Xiaochuan Gong and Jie Xu and Zhengdao Wang and Mingrui Liu},
journal= {arXiv preprint arXiv:2510.14009},
year = {2026}
}