中文

基于梯度下降与早停训练的浅层过参数化神经网络的非参数回归

机器学习 2023-01-02 v3 机器学习

摘要

我们探讨了在通过梯度下降(GD)训练时,过参数化浅层神经网络在有标签噪声和无标签噪声情况下学习 Lipschitz 回归函数的能力。为避免在存在噪声标签时,训练至近乎零训练误差的神经网络在该函数类上不一致的问题,我们提出了一种早停规则,使得我们能够展示最优收敛速率。这为 Hu 等人(2021)的结果提供了一种替代方案,他们研究了在非参数回归中使用 2\ell 2 正则化 GD 训练浅层网络的性能,其结论完全依赖于无限宽网络(神经正切核(NTK))近似。此处我们给出了一种更简洁的分析,该分析基于输入空间的划分论证(如 1-最近邻规则的情形),并结合了经 GD 训练的神经网络对其输入具有光滑性这一事实。在无噪声情形下,证明不依赖于任何核化,可视为有限宽结果。在标签噪声情形下,通过对证明稍作修改,利用 Yao、Rosasco 和 Caponnetto(2007)的技术对噪声进行控制。

关键词

引用

@article{arxiv.2107.05341,
  title  = {Nonparametric Regression with Shallow Overparameterized Neural Networks Trained by GD with Early Stopping},
  author = {Ilja Kuzborskij and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2107.05341},
  year   = {2023}
}

备注

The report contains a critical issue. For details see the note: http://proceedings.mlr.press/v134/kuzborskij21a/kuzborskij21a.pdf