中文

具有记忆的SGD:基本性质与随机加速

机器学习 2025-03-11 v2 最优化与控制

摘要

一个重要的开放问题是对具有幂律谱的二次问题上 mini-batch SGD 类算法的理论可行加速。在非随机情境下,损失收敛 LtCLtξL_t\sim C_Lt^{-\xi} 中的最优指数 ξ\xi 是普通 GD 的两倍,可通过采用合适计划的 Heavy Ball (HB) 实现;但在最小批噪声存在时,这种方法不再有效。我们通过考虑具有任意固定数量 MM 个辅助速度向量的 first-order 方法 (*记忆-MM算法*) 来解决这一挑战。我们首先证明了两种此类算法的等价性,并以适当的特征多项式描述它们。然后我们发展了一种针对信号和噪声传播器的损失展开。使用它,我们显示,稳定记忆-MM算法的损失始终保留普通 GD 的指数 ξ\xi,但可以根据其有效学习率(概括 HB 的学习率)具有不同的常数 CLC_L。我们证明在记忆-1算法中可以使 CLC_L 任意小而保持稳定性。因此,我们提出一种具有时间依赖计划的记忆-1算法,该算法在直觉和实验结果上显示可提高普通 SGD 的指数 ξ\xi

关键词

引用

@article{arxiv.2410.04228,
  title  = {SGD with memory: fundamental properties and stochastic acceleration},
  author = {Dmitry Yarotsky and Maksim Velikanov},
  journal= {arXiv preprint arXiv:2410.04228},
  year   = {2025}
}

备注

ICLR 2025 camera ready