中文

宽神经网络:从初始化时的非高斯随机场到训练的 NTK 几何

机器学习 2023-04-10 v1 神经与进化计算 概率论

摘要

近年来,具有超过 n=1014n=10^{14} 参数的人工神经网络应用发展迅速,使得研究此类网络的大 nn 行为变得极为重要。大多数研究宽神经网络的工作聚焦于此类网络在无限宽度 n+n \to +\infty 极限下的情况,并表明它们在初始化时对应于高斯过程。在本工作中,我们将研究它们在 nn 很大但有限时的行为。我们的主要贡献如下:(1) 计算了以 n12n^{-\frac{1}{2}} 渐近级数表示的高斯性修正。该展开中的系数由参数初始化的统计量和激活函数决定。(2) 通过计算与极限无限宽度情况(在此情况下网络通过线性流演化)的偏差,控制了有限宽度 nn 网络在训练期间输出的演化。这改进了先前的估计,并得到了在整个训练过程中有效的、关于 nn 的(有限宽度)NTK 更尖锐的衰减率。作为推论,我们还证明了以任意高的概率,足够宽的神经网络的训练能收敛到相应二次损失函数的全局最小值。(3) 估计了偏离高斯性的程度如何随训练以 nn 的形式演化。具体而言,在测度空间中使用某种度量,我们发现沿训练过程,所得测度与对应于无限宽度网络的含时高斯过程(该过程由将初始高斯过程与对应于无限宽度极限下训练的线性流进行预复合显式给出)之间的差异在 n12(logn)1+n^{-\frac{1}{2}}(\log n)^{1+} 范围内。

关键词

引用

@article{arxiv.2304.03385,
  title  = {Wide neural networks: From non-gaussian random fields at initialization to the NTK geometry of training},
  author = {Luís Carvalho and João Lopes Costa and José Mourão and Gonçalo Oliveira},
  journal= {arXiv preprint arXiv:2304.03385},
  year   = {2023}
}

备注

44 pages, 2 figures, comments welcome