关于带动量的随机梯度下降的泛化性
机器学习
2021-09-27 v2 最优化与控制
机器学习
摘要
虽然基于动量的方法与随机梯度下降(SGD)结合在训练机器学习模型时被广泛使用,但关于此类方法的泛化误差却鲜有理论理解。本工作中,我们首先证明存在一个凸损失函数,当标准重球动量(SGDM)的 SGD 运行多个轮次时,算法稳定性无法建立泛化保证。随后,对于光滑 Lipschitz 损失函数,我们分析了修正的基于动量的更新规则,即带早期动量(SGDEM)的 SGD,并证明其具有泛化误差的上界。因此,我们的结果表明,机器学习模型可以训练多个轮次的 SGDEM 且具备泛化保证。最后,对于强凸损失函数的特殊情况,我们找到了一个动量范围,使得作为 SGDEM 特殊形式的标准 SGDM 的多个轮次也具有泛化性。在扩展我们的泛化结果的基础上,我们还推导了期望真实风险的上界,其依赖于训练步数、训练集大小和动量参数。实验评估验证了数值结果与我们理论界的一致性以及 SGDEM 对光滑 Lipschitz 损失函数的有效性。
引用
@article{arxiv.2102.13653,
title = {On the Generalization of Stochastic Gradient Descent with Momentum},
author = {Ali Ramezani-Kebrya and Ashish Khisti and Ben Liang},
journal= {arXiv preprint arXiv:2102.13653},
year = {2021}
}
备注
This entry is redundant and was created in error. See arXiv:1809.04564 for the latest version