中文

深度网络中的早停:双下降及其消除方法

机器学习 2020-09-22 v2 机器学习

摘要

过度参数化模型(如大型深度网络)常表现出双下降现象,即作为模型大小的函数,误差先下降、再上升、最后下降。这一引人注目的双下降行为也作为训练轮次的函数出现,并被推测源于训练轮次控制了模型复杂度。本文中,我们表明这种按轮次的双下降源于不同原因:它由两个以上偏差-方差权衡的叠加引起,因为网络的不同部分在不同轮次被学习,且通过适当缩放步长消除该现象可显著改善早停性能。我们针对以下情况解析地展示了这一点:i)线性回归,其中不同缩放的特征引起偏差-方差权衡的叠加;ii)两层神经网络,其中第一层和第二层各自主导一个偏差-方差权衡。受该理论启发,我们对两个标准卷积网络进行实证研究,表明通过调节不同层的步长消除按轮次的双下降可显著改善早停性能。

关键词

引用

@article{arxiv.2007.10099,
  title  = {Early Stopping in Deep Networks: Double Descent and How to Eliminate it},
  author = {Reinhard Heckel and Fatih Furkan Yilmaz},
  journal= {arXiv preprint arXiv:2007.10099},
  year   = {2020}
}

备注

37 pages, 8 figures; changes from version 1: additional numerical results and clarifications