解耦深度神经网络中的特征训练与懒惰训练
机器学习
2020-12-30 v4 机器学习
摘要
随着网络宽度 ,根据最后一层权重如何随 缩放,已推导出深度学习的两种不同极限。在神经切线核(NTK)极限下,动力学在权重上变为线性,并由一个冻结的核 描述。相比之下,在平均场极限下,动力学可用与神经元相关的参数分布来表达,该分布遵循一个偏微分方程。本工作中,我们考虑初始化时最后一层权重缩放为 的深度网络。通过改变 和 ,我们探查了两种极限之间的交叉。我们观测到了先前已确认的懒惰训练与特征训练机制。在懒惰训练机制中,动力学几乎是线性的,且 NTK 在初始化后几乎不变。特征训练机制将平均场公式作为一个极限情形包含在内,其特征是核随时间演化并学习某些特征。我们在 MNIST、Fashion-MNIST、EMNIST 和 CIFAR10 上进行了数值实验,并考虑了多种架构。我们发现:(i) 两种机制由随 缩放的 所分隔。(ii) 网络架构与数据结构在决定哪种机制更优方面起重要作用:在我们的测试中,全连接网络通常在懒惰训练机制下表现更好,而卷积网络则不然。(iii) 在两种机制中,由初始条件引起的对学习函数的涨落 按 衰减,导致性能随 提升。同样的改进也可通过在中等宽度下对多个网络做集成平均获得。(iv) 在特征训练机制中,我们识别出一个时间尺度 ,使得当 时动力学是线性的。
引用
@article{arxiv.1906.08034,
title = {Disentangling feature and lazy training in deep neural networks},
author = {Mario Geiger and Stefano Spigler and Arthur Jacot and Matthieu Wyart},
journal= {arXiv preprint arXiv:1906.08034},
year = {2020}
}
备注
minor revisions