中文

宽神经网络在 $\mathbb{R}$ 上的泛化能力

机器学习 2023-02-14 v1 机器学习

摘要

我们对 R\mathbb{R} 上宽两层 ReLU 神经网络的泛化能力进行了研究。我们首先建立神经正切核(NTK)的一些谱性质:a)a) KdK_{d},定义在 Rd\mathbb{R}^{d} 上的 NTK,是正定的;b)b) λi(K1)\lambda_{i}(K_{1}),即 K1K_{1} 的第 ii 大特征值,与 i2i^{-2} 成正比。我们随后表明:i)i) 当宽度 mm\rightarrow\infty 时,神经网络核(NNK)一致收敛于 NTK;ii)ii) 在对应于 K1K_{1} 的 RKHS 上回归的极小极大速率为 n2/3n^{-2/3}iii)iii) 若在训练宽神经网络时采用早停策略,所得神经网络可达到极小极大速率;iv)iv) 若将神经网络训练至过拟合数据,所得神经网络不能良好泛化。最后,我们提供了一个解释以调和我们的理论与被广泛观察到的“良性过拟合现象”。

关键词

引用

@article{arxiv.2302.05933,
  title  = {Generalization Ability of Wide Neural Networks on $\mathbb{R}$},
  author = {Jianfa Lai and Manyun Xu and Rui Chen and Qian Lin},
  journal= {arXiv preprint arXiv:2302.05933},
  year   = {2023}
}

备注

47 pages, 4 figures