深度学习与核学习:损失景观几何与神经切线核时间演化的实证研究
机器学习
2020-10-29 v1 机器学习
摘要
在适当初始化的宽网络中,小学习率将深度神经网络(DNNs)转化为神经切线核(NTK)机器,其训练动力学可由初始化时网络的线性权重展开很好地近似。然而,标准训练以其尚不甚明了的方式偏离其线性化。我们研究非线性深度网络的训练动力学、损失景观几何以及数据依赖NTK的时间演化之间的关系。为此,我们通过大规模现象学训练分析,综合刻画损失景观几何与NTK动力学的多样化度量。在多种神经架构与数据集中,我们发现这些多样化度量以高度相关的方式演化,揭示了深度学习过程的普适图景。在该图景中,深度网络训练表现出高度混沌的快速初始瞬态,其在2至3个epoch内决定了包含训练终点的低损失最终线性连通盆地。在此混沌瞬态期间,NTK快速变化,从训练数据中学习有用特征,使其在少于3至4个epoch内以3倍的因子优于标准初始NTK。在此快速混沌瞬态之后,NTK以恒定速度变化,其在15%至45%的训练时间内性能与完整网络训练相匹配。总体而言,我们的分析揭示了训练时间内一组多样化度量之间的显著相关性,受前几个epoch中快速混沌到稳定的转变所支配,这共同为发展更精确的深度学习理论带来了挑战与机遇。
引用
@article{arxiv.2010.15110,
title = {Deep learning versus kernel learning: an empirical study of loss landscape geometry and the time evolution of the Neural Tangent Kernel},
author = {Stanislav Fort and Gintare Karolina Dziugaite and Mansheej Paul and Sepideh Kharaghani and Daniel M. Roy and Surya Ganguli},
journal= {arXiv preprint arXiv:2010.15110},
year = {2020}
}
备注
19 pages, 19 figures, In Advances in Neural Information Processing Systems 34 (NeurIPS 2020)