中文

神经形态内核理论中随机初始化的影响

机器学习 2024-10-10 v1 机器学习

摘要

本文旨在讨论神经网络随机初始化在神经形态内核(NTK)理论中的影响,而这一点被大多数近期的NTK理论研究所忽略。众所周知,当网络宽度趋于无限时,带有随机初始化的神经网络会收敛于高斯过程 fGPf^{\mathrm{GP}},其取值在 L2(X)L^{2}(\mathcal{X}) 中,其中 X\mathcal{X} 为数据的域。相比之下,为了采用传统的核回归理论,大多数近期研究引入了特殊的镜像架构和镜像(随机)初始化,以确保网络输出在初始化时恰为零。因此,仍有一个问题:传统设置和镜像初始化是否会导致宽神经网络 exhibit 不同的泛化能力。本文首先展示了带随机初始化的神经网络的梯度流训练动力学在均匀收敛于相应NTK回归的随机初始化 fGPf^{\mathrm{GP}} 的训练动力学。随后我们证明 P(fGP[HNT]s)=1\mathbf{P}(f^{\mathrm{GP}} \in [\mathcal{H}^{\mathrm{NT}}]^{s}) = 1 当且仅当 s<3d+1s < \frac{3}{d+1},而 P(fGP[HNT]s)=0\mathbf{P}(f^{\mathrm{GP}} \in [\mathcal{H}^{\mathrm{NT}}]^{s}) = 0s3d+1s \geq \frac{3}{d+1},其中 [HNT]s[\mathcal{H}^{\mathrm{NT}}]^{s} 为NTK相关RKHS HNT\mathcal{H}^{\mathrm{NT}} 的实插值空间。因此,经过梯度下降训练的宽神经网络的泛化误差为 Ω(n3d+3)\Omega(n^{-\frac{3}{d+3}}),仍受维度诅咒。一方面,结果凸显了镜像初始化的优势;另一方面,结果暗示NTK理论可能不完全解释神经网络的卓越性能。

关键词

引用

@article{arxiv.2410.05626,
  title  = {On the Impacts of the Random Initialization in the Neural Tangent Kernel Theory},
  author = {Guhan Chen and Yicheng Li and Qian Lin},
  journal= {arXiv preprint arXiv:2410.05626},
  year   = {2024}
}