SGD 高维极限定理:动量与自适应步长
机器学习
2026-02-19 v2 机器学习
摘要
我们发展了关于带有 Polyak 动量 (SGD-M) 和自适应步长的随机梯度下降法 (SGD) 的高维尺度极限。这提供了一个框架来严格比较在线 SGD 与其一些流行变体。我们指出,SGD-M 的尺度极限与在线 SGD 相同,只要进行适当的时间重缩放并选择特定的步长。然而,如果步长在两种算法之间保持不变,SGD-M 将放大高维效应,可能相对于在线 SGD 导致性能下降。我们在两个流行学习问题上演示了该框架:Spiked Tensor PCA 和 Single Index Models。在这两种情况下,我们还检查了基于归一化梯度的在线 SGD 的自适应步长。在高维情景下,该算法带来多个好处:其动力学可接受靠近 population 最小值且扩大了可接受步长范围,从而使得迭代收敛到此类解。这些例子为严格说明提供了经验动机,阐明了在在线 SGD 失效的情形下,早期 preconditioner 如何稳定和改善动力学。
引用
@article{arxiv.2511.03952,
title = {High-dimensional limit theorems for SGD: Momentum and Adaptive Step-sizes},
author = {Aukosh Jagannath and Taj Jones-McCormick and Varnan Sarangian},
journal= {arXiv preprint arXiv:2511.03952},
year = {2026}
}