神经网络早期学习动力学令人惊讶的简洁性
机器学习
2020-06-26 v1 神经与进化计算
机器学习
摘要
现代神经网络常被视为复杂的黑盒函数,其行为因对数据的非线性依赖及损失景观中的非凸性而难以理解。本工作中,我们表明这些普遍看法在学习的早期阶段可能完全错误。具体而言,我们形式化证明,对于一类良态输入分布,双层全连接神经网络的早期学习动力学可通过在输入上训练一个简单的线性模型来模拟。我们进一步论证,这种令人惊讶的简洁性可持久存在于具有更多层数及卷积架构的网络中,并通过实验验证。我们分析的关键在于界定初始化时神经切线核(Neural Tangent Kernel, NTK)与数据核的仿射变换之间差异的谱范数;然而,与许多利用 NTK 的先前结果不同,我们不要求网络具有不成比例的大宽度,且网络允许在训练后期逃离核 regime。
引用
@article{arxiv.2006.14599,
title = {The Surprising Simplicity of the Early-Time Learning Dynamics of Neural Networks},
author = {Wei Hu and Lechao Xiao and Ben Adlam and Jeffrey Pennington},
journal= {arXiv preprint arXiv:2006.14599},
year = {2020}
}