中文

通过非欧几里得信任区域优化理解深度学习中的梯度正交化

机器学习 2025-04-09 v2 最优化与控制 机器学习

摘要

矩阵梯度正交化优化最近在深度神经网络训练中展现出惊人的效果(Jordan等人,2024;Liu等人,2025)。本文提供了该方法的理论分析。特别是,我们展示了正交化梯度方法可被视为以矩阵谱范数为界定义的信任区域优化的rey-first-order方法。受此启发,我们发展出具有动量的随机非欧几里得信任区域梯度方法,这恢复了Muon优化器(Jordan等人,2024)作为一种特殊情况,以及带动量的归一化SGD和signSGD(Cutkosky和Mehta,2020;Sun等人,2023)。此外,我们在涉及任意非欧几里得范数、受限和复合问题以及非凸、星凸、一次和二阶光滑函数的各种情景下,为所提出算法证明了最先进的收敛结果。最后,我们的理论发现为观察到的实践现象提供了解释,包括Muon相对于Tuddenham等人(2022)的Orthogonal-SGDM算法的实际优势以及大规模语言模型训练中权重衰减的重要性。

关键词

引用

@article{arxiv.2503.12645,
  title  = {Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization},
  author = {Dmitry Kovalev},
  journal= {arXiv preprint arXiv:2503.12645},
  year   = {2025}
}