适应或遗忘:Adam与SGD在非平稳优化中的可证明权衡
机器学习
2026-05-07 v1 机器学习
摘要
我们对Adam在非平稳随机目标下的行为进行了理论分析,将其分为两个 regime:在Adam预条件化均值梯度算子自适应强单调性的欧几里得跟踪 regime,以及在一般-光滑目标下获得高概率投影stationarity保证的 regime。在跟踪 regime中,我们推导了有限时间的预期界限和高概率界限,严格分解为四个组成部分:初始化、目标漂移、由控制的一阶矩跟踪误差,以及由控制的预条件器扰动。在常数步幅和步衰减schedule下,我们 characterize了到达Adam不可约跟踪底的burn-in时间。我们还证明了Adam在分布迁移下对平均投影stationarity gap的高概率界限。跨越两个分析,我们的界限揭示了一种噪声-漂移权衡:在噪声主导的 regime中,一阶矩平均和自适应预条件化可改善高概率误差;而在漂移主导的 regime中,过时的一阶矩信息和预条件器扰动会使非平稳性的代价加倍,使得vanilla SGD能够实现更小的跟踪底。我们明确的的-依赖界限阐明了在何时使用自适应步幅获益 Versus 有害,提供了Adam在分布迁移下经验不稳定性与稳定性的理论机制。
引用
@article{arxiv.2605.04269,
title = {Adapt or Forget: Provable Tradeoffs Between Adam and SGD in Nonstationary Optimization},
author = {Sharan Sahu and Abir Sarkar and Cameron J. Hogan and Martin T. Wells},
journal= {arXiv preprint arXiv:2605.04269},
year = {2026}
}
备注
39 pages, 11 figures, 1 table