关于神经优化器在矩阵算子范数下宽度扩展的研究 I:行/列归一化与超参数迁移
机器学习
2026-03-11 v1 数值分析
系统与控制
系统与控制
数值分析
最优化与控制
机器学习
摘要
现代深度学习的核心问题之一是如何设计在网络宽度增加时行为保持稳定的优化器。我们通过将几种广泛使用的神经网络优化器,包括 AdamW 和 Muon,解释为矩阵算子范数下的最陡下降实例来回答这一问题。这种视角将优化器几何与网络前向映射的Lipschitz结构联系起来,使我们能够在宽度上实现对Lipschitz常数和光滑性常数的独立控制。然而,由标准 p→q 算子范数诱导的最坡下降规则缺乏层wise 可组合性,因此无法在深层架构中提供宽度独立的界限。我们通过引入一族均值归一化算子范数, denoted pmean→qmean,来克服这一限制,这些范数具有层wise 可组合性,产生宽度独立的光滑性界限,并导致实用的优化器,如 rescalced AdamW、行归一化和列归一化。 resulting 的学习率宽度感知 scaling 规则将 μP scaling~\cite{yang2021tensor} 作为一个特殊情况恢复,并为跨宽度学习率迁移提供了原则性机制。我们进一步表明,Muon 在光滑性常数上可能出现 O(√w) 的最坏情况增长,而我们提出的新型行归一化优化器族实现了宽度独立的光滑性保证。基于这些观察,我们提出 MOGA(Matrix Operator Geometry Aware),一种仅基于行/列归一化即可实现稳定跨模型宽度学习率迁移的宽度感知优化器。在大规模预训练 GPT-2 和 LLaMA 上,实验表明,MOGA,特别是采用行归一化, 在 large-token 和 low-loss regime 中比 Muon 更快,同时性能相当。
引用
@article{arxiv.2603.09952,
title = {On the Width Scaling of Neural Optimizers Under Matrix Operator Norms I: Row/Column Normalization and Hyperparameter Transfer},
author = {Ruihan Xu and Jiajin Li and Yiping Lu},
journal= {arXiv preprint arXiv:2603.09952},
year = {2026}
}