梯度方法在可分数据上从不过拟合
机器学习
2020-09-11 v2 机器学习
摘要
近期一系列工作表明,当在可分数据上训练线性预测器并使用梯度方法与指数尾损失时,预测器在方向上渐近收敛于最大间隔预测器。因此,预测器渐近地不过拟合。然而,这并未解决在经过有界次迭代后非渐近地发生过拟合的可能性问题。在本文中,我们正式证明标准梯度方法(特别是梯度流、梯度下降与随机梯度下降)在可分数据上从不过拟合:若我们在大小为的数据集上运行这些方法次迭代,经验风险与泛化误差均以的近乎最优速率下降,直至,此时泛化误差固定在的近乎最优水平,无论多大皆然。在此过程中,我们给出了数据集上间隔违例次数的非渐近界,并证明了其紧性。
引用
@article{arxiv.2007.00028,
title = {Gradient Methods Never Overfit On Separable Data},
author = {Ohad Shamir},
journal= {arXiv preprint arXiv:2007.00028},
year = {2020}
}
备注
Added a short appendix on polynomially-tailed losses; some minor edits