具有记忆的SGD:基本性质与随机加速
机器学习
2025-03-11 v2 最优化与控制
摘要
一个重要的开放问题是对具有幂律谱的二次问题上 mini-batch SGD 类算法的理论可行加速。在非随机情境下,损失收敛 中的最优指数 是普通 GD 的两倍,可通过采用合适计划的 Heavy Ball (HB) 实现;但在最小批噪声存在时,这种方法不再有效。我们通过考虑具有任意固定数量 个辅助速度向量的 first-order 方法 (*记忆-算法*) 来解决这一挑战。我们首先证明了两种此类算法的等价性,并以适当的特征多项式描述它们。然后我们发展了一种针对信号和噪声传播器的损失展开。使用它,我们显示,稳定记忆-算法的损失始终保留普通 GD 的指数 ,但可以根据其有效学习率(概括 HB 的学习率)具有不同的常数 。我们证明在记忆-1算法中可以使 任意小而保持稳定性。因此,我们提出一种具有时间依赖计划的记忆-1算法,该算法在直觉和实验结果上显示可提高普通 SGD 的指数 。
关键词
引用
@article{arxiv.2410.04228,
title = {SGD with memory: fundamental properties and stochastic acceleration},
author = {Dmitry Yarotsky and Maksim Velikanov},
journal= {arXiv preprint arXiv:2410.04228},
year = {2025}
}
备注
ICLR 2025 camera ready