中文

何时以及为何 SignSGD 优于 SGD:基于 $\ell_1$-范数下界的理论研究

机器学习 2026-05-08 v1 人工智能 计算与语言 最优化与控制

摘要

基于符号的优化算法,如 SignSGD 和 Muon,因其在训练大型基础模型中的卓越性能而备受关注。尽管取得了这些经验上的成功,我们仍然缺乏关于这些基于符号的方法何时以及为何优于原始 SGD 的理论理解。核心障碍在于,在标准光滑性与有限方差条件下,已知 SGD 在以 2\ell_2-范数度量的驻点寻找上是最小最大最优的,从而从根本上排除了基于符号的方法在标准设置中获得任何复杂度收益的可能。为克服这一障碍,我们利用 1\ell_1-范数驻点性、\ell_\infty-光滑性以及可分离噪声模型分析了基于符号的优化器,这能更好地捕捉符号更新的逐坐标性质。在这种独特的问题几何下,我们推导了 SignSGD 的匹配上下界,并显式刻画了 SignSGD 可证明优于 SGD 的问题类。具体而言,我们将 SignSGD 的上界与 SGD 的下界进行比较,表明在稀疏噪声下,SignSGD 有效地将复杂度降低了 dd 的因子,其中 dd 为问题维度。此外,我们将该框架提升至矩阵域,为 Muon 优化器提供了等价的最优下界,证明将符号算子扩展至矩阵保持了这种关于维度的最优缩放。最后,我们将理论界限与实践相联系,证明 SignSGD 的理论优越性准确预测了其在 124M 参数 GPT-2 模型预训练期间更快的收敛速度。

关键词

引用

@article{arxiv.2605.06615,
  title  = {When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\ell_1$-norm Lower Bounds},
  author = {Hongyi Tao and Dingzhi Yu and Lijun Zhang},
  journal= {arXiv preprint arXiv:2605.06615},
  year   = {2026}
}

备注

Code is available at https://github.com/Dingzhen230/SignSGD_Outperforms_SGD