中文

从SGD到Muon:通过Schatten-p范数实现自适应优化

人工智能 2026-05-20 v1

摘要

现代优化器,如Muon,对其更新施加矩阵层面的几何约束。这些矩阵层面的约束可以在线性最小化预言机(LMO)理论下统一。然而,当前所有方法都为更新规则施加了固定的LMO几何,这些几何是通过设计或经验选择的,不一定根据问题的几何是最优的。我们引入了一种新颖高效的数据驱动准则,用于在单个深度神经网络层上动态选择代理最优的更新LMO几何。该准则使用单步随机特征回归代理模型,从梯度和激活统计量中以闭式形式导出,在从SGD到Muon更新的设计空间中进行插值导航。此外,集成参数逐元素预处理使我们的框架能够将SGD、Muon、Adam和MuAdam恢复为特定的极值。为了使这种自适应方法可扩展,我们将其与高效的计算策略相结合,在高度优化的基线上仅实现约3%的运行时间开销。作为概念验证,我们展示了这种数据驱动的优化器在三种不同的训练场景中,其性能优于或保持与Muon和AdamW中表现最佳的优化器相竞争。最终,这项工作提供了证据,表明LMO几何可以成功且高效地从运行时数据中自适应,为超越静态几何的优化器设计开辟了一条新途径。

关键词

引用

@article{arxiv.2605.19781,
  title  = {From SGD to Muon: Adaptive Optimization via Schatten-p Norms},
  author = {Thomas Massena and Corentin Friedrich and Mathieu Serrurier},
  journal= {arXiv preprint arXiv:2605.19781},
  year   = {2026}
}