中文

关于带动量的随机梯度下降的泛化性

机器学习 2024-01-17 v3 机器学习

摘要

虽然基于动量的随机梯度下降(SGD)加速变体在训练机器学习模型时被广泛使用,但关于此类方法的泛化误差却鲜有理论理解。在这项工作中,我们首先证明存在一个凸损失函数,使得标准重球动量(SGDM)的多个 epoch 的稳定性间隙变为无界。然后,对于光滑 Lipschitz 损失函数,我们分析了修改后的基于动量的更新规则,即早期动量 SGD(SGDEM)在广泛步长范围内的表现,并表明它可以在保证泛化的前提下训练机器学习模型多个 epoch。最后,对于强凸损失函数的特殊情况,我们找到了一个动量范围,使得作为 SGDEM 特殊形式的标准 SGDM 的多个 epoch 也能泛化。在扩展我们关于泛化的结果时,我们还推导了期望真实风险的上界,该上界用训练步数、样本量和动量表示。我们的实验评估验证了数值结果与我们的理论界之间的一致性。在 ImageNet 上以实际分布式设置训练 ResNet-18 时,SGDEM 改善了 SGDM 的泛化误差。

关键词

引用

@article{arxiv.1809.04564,
  title  = {On the Generalization of Stochastic Gradient Descent with Momentum},
  author = {Ali Ramezani-Kebrya and Kimon Antonakopoulos and Volkan Cevher and Ashish Khisti and Ben Liang},
  journal= {arXiv preprint arXiv:1809.04564},
  year   = {2024}
}

备注

56 pages, 14 figures. To appear in the Journal of Machine Learning Research (JMLR)