中文

非平稳随机优化中动量 SGD 可证明次优性研究

机器学习 2026-05-20 v4 机器学习 最优化与控制

摘要

本文对随机梯度下降(SGD)及其动量变体(Polyak 重球法和 Nesterov 加速法)在强凸性和光滑性条件下追踪时变最优解的性能进行了全面的理论分析。我们的有限时间界揭示了跟踪误差可被清晰地分解为瞬态分量、噪声诱导分量和漂移诱导分量。这一分解揭示了一个根本性的权衡:虽然动量常被用作梯度平滑的启发式方法,但在分布偏移下,它会带来显式的漂移放大惩罚,且该惩罚随着动量参数 β\beta 趋近于 1 而发散,从而产生系统性的跟踪滞后。我们通过梯度变化约束下的极小极大下界对这些上界进行了补充,证明了这种动量诱导的跟踪惩罚并非分析上的伪影,而是一个信息论障碍:在漂移主导的情况下,由于陈旧梯度的平均化迫使产生系统性滞后,动量方法不可避免地表现更差。我们的结果为动量在动态环境中的经验不稳定性提供了理论基础,并精确界定了普通 SGD 可证明优于其加速对应方法的机制边界。

关键词

引用

@article{arxiv.2601.12238,
  title  = {On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization},
  author = {Sharan Sahu and Cameron J. Hogan and Martin T. Wells},
  journal= {arXiv preprint arXiv:2601.12238},
  year   = {2026}
}

备注

Accepted to ICML 2026. 75 pages, 5 figures, 4 tables