收敛到全局最优的学习算法的稳定性与泛化
机器学习
2017-10-25 v1 信息论
机器学习
math.IT
最优化与控制
摘要
我们为收敛到全局最小的学习算法建立了新的泛化界。我们通过推导黑箱稳定性结果来实现这一点,该结果仅依赖于学习算法的收敛性和损失函数最小值附近的几何形状。这些结果针对满足Polyak-Łojasiewicz(PL)条件和二次增长(QG)条件的非凸损失函数给出。我们进一步表明,这些条件出现在一些具有线性激活函数的神经网络中。我们使用黑箱结果建立了优化算法(如随机梯度下降(SGD)、梯度下降(GD)、随机坐标下降(RCD)和随机方差缩减梯度法(SVRG))在PL和强凸设置下的稳定性。我们的结果匹配或改进了最先进的泛化界,并且可以轻松扩展到类似的优化算法。最后,我们表明,尽管我们的结果暗示在PL设置中SGD和GD具有相当的稳定性,但存在具有多个局部最小的简单神经网络,其中SGD是稳定的而GD不是。
引用
@article{arxiv.1710.08402,
title = {Stability and Generalization of Learning Algorithms that Converge to Global Optima},
author = {Zachary Charles and Dimitris Papailiopoulos},
journal= {arXiv preprint arXiv:1710.08402},
year = {2017}
}
备注
27 pages, 5 figures