中文

高维核方法中学习动力学的三阶段

机器学习 2021-11-16 v1 机器学习 统计理论 统计理论

摘要

要理解深度学习的运作机制,关键在于理解神经网络的训练动力学。基于经验观测现象,人们针对这些动力学提出了若干有趣的假设,但关于此类现象何时及为何出现的理论理解仍很有限。本文考虑核最小二乘目标上梯度流的训练动力学,这是 SGD 训练的神经网络的一种极限动力学。利用精确的高维渐近,我们刻画了拟合模型在两个“世界”中的动力学:在 Oracle 世界中模型在总体分布上训练,在 Empirical 世界中模型在采样数据集上训练。我们证明,在核与 L2L^2 目标回归函数的温和条件下,训练动力学经历三个阶段,其由两世界中模型的行为所刻画。我们的理论结果也从数学上形式化了若干有趣的深度学习现象。具体而言,在我们的设定中,我们展示了 SGD 逐步学习更复杂的函数,并且存在“深度自助”现象:在第二阶段,尽管经验训练误差小得多,两世界的测试误差仍保持接近。最后,我们给出一个比较两种不同核动力学的实例,表明更快的训练未必带来更好的泛化。

关键词

引用

@article{arxiv.2111.07167,
  title  = {The Three Stages of Learning Dynamics in High-Dimensional Kernel Methods},
  author = {Nikhil Ghosh and Song Mei and Bin Yu},
  journal= {arXiv preprint arXiv:2111.07167},
  year   = {2021}
}