深度神经网络的动力学与神经切线层级
机器学习
2019-09-19 v1 机器学习
摘要
由梯度下降训练的深度神经网络的演化可由其神经切线核(NTK)描述,如 [20] 所引入,其中证明了在无限宽度极限下 NTK 收敛到一个显式极限核并且在训练期间保持恒定。NTK 在其他一些近期论文 [6,13,14] 中也是隐含的。在过参数化 regime 下,充分训练的深度神经网络确实等价于使用极限 NTK 的核回归预测器。并且梯度下降对深度过参数化神经网络实现了零训练损失。然而,在 [5] 中观察到使用极限 NTK 的核回归与深度神经网络之间存在性能差距。这一性能差距很可能源于有限宽度效应导致的 NTK 在训练过程中的变化。NTK 沿训练的变化是刻画深度神经网络泛化特性的核心。在当前论文中,我们研究有限宽度深度全连接神经网络的 NTK 动力学。我们推导了一组无穷常微分方程层级,即神经切线层级(NTH),其捕捉深度神经网络的梯度下降动力学。此外,在关于神经网络宽度和数据集维度的一定条件下,我们证明 NTH 的截断层级以任意精度逼近 NTK 的动力学。这一描述使得直接研究深度神经网络 NTK 的变化成为可能,并阐明了深度神经网络优于使用相应极限 NTK 的核回归这一观察。
引用
@article{arxiv.1909.08156,
title = {Dynamics of Deep Neural Networks and Neural Tangent Hierarchy},
author = {Jiaoyang Huang and Horng-Tzer Yau},
journal= {arXiv preprint arXiv:1909.08156},
year = {2019}
}