中文

解耦深度神经网络中的特征训练与懒惰训练

机器学习 2020-12-30 v4 机器学习

摘要

随着网络宽度 hh\rightarrow \infty,根据最后一层权重如何随 hh 缩放,已推导出深度学习的两种不同极限。在神经切线核(NTK)极限下,动力学在权重上变为线性,并由一个冻结的核 Θ\Theta 描述。相比之下,在平均场极限下,动力学可用与神经元相关的参数分布来表达,该分布遵循一个偏微分方程。本工作中,我们考虑初始化时最后一层权重缩放为 αh1/2\alpha h^{-1/2} 的深度网络。通过改变 α\alphahh,我们探查了两种极限之间的交叉。我们观测到了先前已确认的懒惰训练与特征训练机制。在懒惰训练机制中,动力学几乎是线性的,且 NTK 在初始化后几乎不变。特征训练机制将平均场公式作为一个极限情形包含在内,其特征是核随时间演化并学习某些特征。我们在 MNIST、Fashion-MNIST、EMNIST 和 CIFAR10 上进行了数值实验,并考虑了多种架构。我们发现:(i) 两种机制由随 h1/2h^{-1/2} 缩放的 α\alpha^* 所分隔。(ii) 网络架构与数据结构在决定哪种机制更优方面起重要作用:在我们的测试中,全连接网络通常在懒惰训练机制下表现更好,而卷积网络则不然。(iii) 在两种机制中,由初始条件引起的对学习函数的涨落 δF\delta FδF1/h\delta F\sim 1/\sqrt{h} 衰减,导致性能随 hh 提升。同样的改进也可通过在中等宽度下对多个网络做集成平均获得。(iv) 在特征训练机制中,我们识别出一个时间尺度 t1hαt_1\sim\sqrt{h}\alpha,使得当 tt1t\ll t_1 时动力学是线性的。

关键词

引用

@article{arxiv.1906.08034,
  title  = {Disentangling feature and lazy training in deep neural networks},
  author = {Mario Geiger and Stefano Spigler and Arthur Jacot and Matthieu Wyart},
  journal= {arXiv preprint arXiv:1906.08034},
  year   = {2020}
}

备注

minor revisions