中文

预条件范数:最速下降法、拟牛顿法与自适应方法的统一框架

机器学习 2026-05-19 v3 最优化与控制

摘要

优化是现代深度学习核心,然而现有方法常常面临适应问题几何与利用曲率信息之间的基本权衡。最速下降算法通过范数选择适应不同几何,但严格保持一阶;而拟牛顿法和自适应优化器虽包含曲率信息,却受限于Frobenius几何,限制了其在多样化架构中的适用性。在这项工作中,我们提出了一个统一框架,通过预条件矩阵范数这一新颖概念,推广了最速下降法、拟牛顿法和自适应方法。这一抽象揭示了广泛使用的优化器如SGD和Adam,以及更先进的方法如Muon和KL-Shampoo,以及最近的混合方法如SOAP和SPlus,都是同一原理的特例。在此框架内,我们首次系统性地处理了矩阵参数化设置下的仿射不变性和尺度不变性,建立了广义范数下的充分必要条件。在此基础之上,我们引入了两种新方法,MuAdam\texttt{MuAdam}MuAdam-SANIA\texttt{MuAdam-SANIA},它们结合了Muon的谱几何与Adam风格预条件。我们的实验表明,这些优化器与现有最先进方法相比具有竞争力,并且在某些情况下表现更优。我们的代码可在 https://github.com/brain-lab-research/LIB/tree/quasi_descent 获取。

关键词

引用

@article{arxiv.2510.10777,
  title  = {Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods},
  author = {Andrey Veprikov and Arman Bolatov and Aleksandr Bogdanov and Samuel Horváth and Aleksandr Beznosikov and Martin Takáč and Slavomir Hanzely},
  journal= {arXiv preprint arXiv:2510.10777},
  year   = {2026}
}

备注

22 pages, 2 figures, 8 tables