中文

使用铰链损失在含噪数据上训练浅层 ReLU 网络:何时过拟合及其是否良性?

机器学习 2023-11-10 v2

摘要

我们研究使用梯度下降与铰链损失在含噪二分类数据上训练的双层 ReLU 网络中的良性过拟合现象。具体而言,我们考虑线性可分数据,其中较小比例的标签被损坏或翻转。我们给出了关于干净数据间隔的条件,其导致三种不同的训练结果:良性过拟合,即达到零损失且以高概率正确分类测试数据;过拟合,即达到零损失但测试数据被误分类的概率以下界为常数;非过拟合,即干净点而非损坏点达到零损失,且同样以高概率正确分类测试数据。我们的分析细致刻画了整个训练过程中神经元的动态,并揭示两个 distinct 阶段:第一阶段干净点达到接近零的损失,第二阶段干净点在零损失边界振荡,而损坏点要么收敛至零损失,要么最终被网络置零。我们使用组合方法证明这些结果,该方法涉及在这些训练阶段中对干净点与损坏点更新次数的界定。

关键词

引用

@article{arxiv.2306.09955,
  title  = {Training shallow ReLU networks on noisy data using hinge loss: when do we overfit and is it benign?},
  author = {Erin George and Michael Murray and William Swartworth and Deanna Needell},
  journal= {arXiv preprint arXiv:2306.09955},
  year   = {2023}
}

备注

48 pages, 2 figures, 1 table