关于带动量的随机梯度下降中的超参数
机器学习
2022-09-13 v2 偏微分方程分析
最优化与控制
机器学习
摘要
遵循与 [SSJ20] 相同的路径,我们在本文中继续给出带动量的随机梯度下降(SGD with momentum)的理论分析。不同之处在于,对于带动量的 SGD,我们证明是非凸优化中线性收敛速率起显著作用的两个超参数——学习率与动量系数——共同发挥作用。我们的分析基于使用一个超参数依赖的随机微分方程(hp-dependent SDE)作为带动量 SGD 的连续代理。类似地,我们建立了带动量 SGD 连续时间形式的线性收敛,并通过分析 Kramers-Fokker-Planck 算子的谱得到了最优线性速率的显式表达式。通过比较,我们展示了当引入动量且动量系数从零增至一时,仅关于学习率的 SGD 的最优线性收敛速率与最终间隙如何随动量系数变化。进而,我们对实践中带动量的 SGD 比标准 SGD 收敛更快且对学习率更鲁棒给出了数学解释。最后,我们表明在噪声存在下 Nesterov 动量与标准动量无本质区别。
引用
@article{arxiv.2108.03947,
title = {On the Hyperparameters in Stochastic Gradient Descent with Momentum},
author = {Bin Shi},
journal= {arXiv preprint arXiv:2108.03947},
year = {2022}
}
备注
34 pages, 4 figures. arXiv admin note: text overlap with arXiv:2004.06977