中文

AdamW 样式 Shampoo 收敛率分析:统一单边与双边预条件化

最优化与控制 2026-05-26 v3 机器学习

摘要

本文研究了 AdamW 样式 Shampoo 优化器,这是一种经典 Shampoo 的有效实现,显著赢得了 AlgoPerf 神经网络训练算法竞赛的外部调优赛。我们的分析统一了单边和双边预条件化,建立了收敛率 1Kk=1KE[f(Xk)]O(m+nCK1/4)\frac{1}{K}\sum_{k=1}^K E\left[\|\nabla f(X_k)\|_*\right]\leq O(\frac{\sqrt{m+n}C}{K^{1/4}}),其中 KK 表示迭代次数,(m,n)(m,n) 表示矩阵参数的大小,CC 匹配 SGD 最优收敛率常数。理论上,我们有 f(X)Ff(X)m+nf(X)F\|\nabla f(X)\|_F\leq \|\nabla f(X)\|_*\leq \sqrt{m+n}\|\nabla f(X)\|_F,支持我们收敛率可视为在理想情况下 f(X)=Θ(m+n)f(X)F\|\nabla f(X)\|_*= \Theta(\sqrt{m+n})\|\nabla f(X)\|_Fmmnn 平衡时,SGD 最优收敛率 1Kk=1KE[f(Xk)F]O(CK1/4)\frac{1}{K}\sum_{k=1}^KE\left[\|\nabla f(X_k)\|_F\right]\leq O(\frac{C}{K^{1/4}}) 的类比结果。

关键词

引用

@article{arxiv.2601.07326,
  title  = {Convergence Rate Analysis of the AdamW-Style Shampoo: Unifying One-Sided and Two-Sided Preconditioning},
  author = {Huan Li and Yiming Dong and Zhouchen Lin},
  journal= {arXiv preprint arXiv:2601.07326},
  year   = {2026}
}