中文

早停梯度下降对过参数化神经网络的标签噪声具有可证明的鲁棒性

机器学习 2019-07-05 v3 机器学习

摘要

现代神经网络通常在过参数化机制下训练,其中模型参数远超训练数据规模。原则上,此类神经网络有能力(过)拟合任意标签集合,包括纯噪声。尽管如此,看似矛盾的是,通过一阶方法训练的神经网络模型仍能对未见的测试数据做出良好预测。本文朝揭开这一现象迈出一步。在一个丰富的数据集模型下,我们证明梯度下降对恒定比例标签上的噪声/损坏具有可证明的鲁棒性,尽管存在过参数化。具体而言,我们证明:(i) 在更新仍接近初始化的前几次迭代中,梯度下降仅拟合正确标签,基本忽略噪声标签。(ii) 要开始过拟合噪声标签,网络必须偏离初始化较远,而这只能在更多次迭代后才可能发生。这些结果共同表明,带早停的梯度下降对标签噪声具有可证明的鲁棒性,并阐明了深度网络的经验鲁棒性以及为防止过拟合而普遍采用的启发式方法。

关键词

引用

@article{arxiv.1903.11680,
  title  = {Gradient Descent with Early Stopping is Provably Robust to Label Noise for Overparameterized Neural Networks},
  author = {Mingchen Li and Mahdi Soltanolkotabi and Samet Oymak},
  journal= {arXiv preprint arXiv:1903.11680},
  year   = {2019}
}