深度神经网络中由初始化引发的一类泛化误差
机器学习
2020-06-02 v3 人工智能
机器学习
摘要
初始化和损失函数如何影响深度神经网络(DNN)的学习,特别是其泛化误差,是实践中的一个重要问题。在本工作中,通过利用 NTK regime 下 DNN 训练动力学的线性性质 \citep{jacot2018neural,lee2019wide},我们对此问题给出了显式且定量的回答。聚焦于回归问题,我们证明:在 NTK regime 下,对于一类一般函数中的任意损失,DNN 找到相同的\emph{全局}极小——即参数空间中离初始值最近的那个,等价地,在相应再生核 Hilbert 空间中离初始 DNN 输出最近的那个。利用这些优化问题,我们量化了初始输出的影响,并证明随机的非零初始输出会增大泛化误差。我们进一步提出一种反对称初始化(ASI)技巧,消除了此类误差并加速了训练。为理解上述结果是否具有一般性,我们还在非 NTK regime 下对 DNN 进行了实验,从定性上证明了我们的理论结果及 ASI 技巧的有效性。总体而言,我们的工作可作为进一步研究初始化和损失函数对 DNN 泛化影响的基线,并有可能指导和改进实践中 DNN 的训练。
引用
@article{arxiv.1905.07777,
title = {A type of generalization error induced by initialization in deep neural networks},
author = {Yaoyu Zhang and Zhi-Qin John Xu and Tao Luo and Zheng Ma},
journal= {arXiv preprint arXiv:1905.07777},
year = {2020}
}
备注
Accepted by MSML Revised the proof of Lemma 2