中文

过参数化模型中的核机制与丰富机制

机器学习 2020-07-28 v3 机器学习

摘要

近期一系列研究在“核机制(kernel regime)”下研究过参数化神经网络,即网络在训练期间表现为核化线性预测器,从而用梯度下降训练具有寻找最小 RKHS 范数解的效果。这与其他一些研究形成对比,后者展示了过参数化多层网络上的梯度下降如何诱导出并非 RKHS 范数的丰富隐式偏置。基于 Chizat 和 Bach 的观察,我们展示了初始化的尺度如何控制“核(亦称懒惰)”与“丰富(亦称主动)”机制之间的转变,并影响多层齐次模型的泛化性质。我们还强调了在初始化时预测器不恒为零的情况下模型宽度所起的有趣作用。我们针对一类简单的深度-DD 模型给出了完整详尽的分析,其已展现出核机制与丰富机制之间有趣且有意义的转变,并且我们也在更复杂的矩阵分解模型与多层非线性网络上通过实验证明了这一转变。

关键词

引用

@article{arxiv.2002.09277,
  title  = {Kernel and Rich Regimes in Overparametrized Models},
  author = {Blake Woodworth and Suriya Gunasekar and Jason D. Lee and Edward Moroshko and Pedro Savarese and Itay Golan and Daniel Soudry and Nathan Srebro},
  journal= {arXiv preprint arXiv:2002.09277},
  year   = {2020}
}

备注

This updates and significantly extends a previous article (arXiv:1906.05827), Sections 6 and 7 are the most major additions. 31 pages. arXiv admin note: text overlap with arXiv:1906.05827