中文

三重下降与两类过拟合:它们出现在何处及为何出现?

机器学习 2022-01-12 v2 无序系统与神经网络 机器学习

摘要

近期一系列研究强调了深度学习中“双重下降”现象的存在,即增加训练样本数 NN 会使神经网络的泛化误差在 NN 与参数数 PP 同阶时达到峰值。在更早的工作中,类似现象被证明存在于线性回归等更简单的模型中,其峰值出现在 NN 等于输入维度 DD 时。由于两个峰值都与插值阈值重合,文献中常将二者混为一谈。本文中,我们表明尽管表面相似,这两种情形本质不同。事实上,当神经网络应用于含噪回归任务时,两个峰值可共存。峰值的相对大小由激活函数的非线性程度决定。基于随机特征模型分析的最新进展,我们为这一样本层面的三重下降提供了理论依据。如前所示,N ⁣= ⁣PN\!=\!P 处的非线性峰值是由输出函数对污染标签的噪声与随机特征(或神经网络权重)初始化的极端敏感性引起的真正发散。该峰值在无噪声时依然存在,但可被正则化抑制。相反,N ⁣= ⁣DN\!=\!D 处的线性峰值仅由对标签噪声的过拟合造成,并在训练更早阶段形成。我们表明该峰值被非线性隐式正则化,这正是它仅在强噪声下显著且受显式正则化弱影响的原因。全文我们还将随机特征模型中得到的解析结果与深度神经网络的数值实验进行了比较。

关键词

引用

@article{arxiv.2006.03509,
  title  = {Triple descent and the two kinds of overfitting: Where & why do they appear?},
  author = {Stéphane d'Ascoli and Levent Sagun and Giulio Biroli},
  journal= {arXiv preprint arXiv:2006.03509},
  year   = {2022}
}