过参数化模型 SGD 的快速与更快速收敛及加速感知机
机器学习
2019-04-09 v3 机器学习
摘要
现代机器学习关注能够完全拟合或插值数据、从而实现零训练损失的高度可表达模型。对于此类模型,我们证明了常用损失函数的随机梯度满足强增长条件。在该条件下,我们证明带有 Nesterov 加速的常数步长随机梯度下降(SGD)在凸函数和强凸函数上均匹配确定性加速方法的收敛速率。我们还表明,该条件意味着在非凸设定下 SGD 能像全梯度下降一样高效地找到一阶平稳点。在插值条件下,我们进一步证明所有具有有限和结构的光滑损失函数都满足较弱的增长条件。给定此较弱条件,我们证明常数步长的 SGD 在强凸和凸设定下均达到确定性收敛速率。在额外假设下,上述结果使我们能够证明使用平方铰链损失的随机感知机算法在 k 次迭代下具有 O(1/k^2) 误分类界。最后,我们在合成和真实数据集上通过实验验证了我们的理论发现。
引用
@article{arxiv.1810.07288,
title = {Fast and Faster Convergence of SGD for Over-Parameterized Models and an Accelerated Perceptron},
author = {Sharan Vaswani and Francis Bach and Mark Schmidt},
journal= {arXiv preprint arXiv:1810.07288},
year = {2019}
}
备注
AISTATS 2019