可分离数据上梯度下降的收敛性
机器学习
2019-03-26 v3 机器学习
摘要
我们详细研究了当在可分离数据集上优化具有严格单调尾部的损失函数(如logistic损失)时,梯度下降的隐式偏置。我们关注两个基本问题:(a)损失函数尾部满足何种条件时,梯度下降会沿最大间隔分离器的方向收敛?(b)间隔收敛速率如何依赖于损失函数尾部与步长选择?我们证明,对于一大类超多项式尾部损失,任意深度线性网络上的梯度下降迭代都沿最大间隔解的方向收敛,而对于尾部更重的损失这不成立。在该类损失中,对于简单线性模型,我们证明采用固定步长时的最优速率确实由常用的指数尾部损失(如logistic损失)取得。然而,如Soudry等人(2018)所证,固定步长下最优收敛速率极慢,为。对于指数损失的线性模型,我们进一步证明通过使用补偿快速消失梯度的激进步长,收敛速率可提升至。数值结果表明该方法可能对深度网络有用。
引用
@article{arxiv.1803.01905,
title = {Convergence of Gradient Descent on Separable Data},
author = {Mor Shpigel Nacson and Jason D. Lee and Suriya Gunasekar and Pedro H. P. Savarese and Nathan Srebro and Daniel Soudry},
journal= {arXiv preprint arXiv:1803.01905},
year = {2019}
}
备注
AISTATS Camera ready version