中文

无神经切线核的浅层神经网络梯度下降的稳定性与泛化

机器学习 2021-11-10 v2 机器学习 统计理论 统计理论

摘要

我们重新审视了用于训练过参数化浅层神经网络的 GD(梯度下降)的平均算法稳定性,并在无 NTK 或 PL 假设下证明了新的泛化与超额风险界。特别地,我们给出了预言机类型的界,揭示了 GD 的泛化与超额风险受一个插值网络的控制,该网络具有从初始化出发最短的 GD 路径(在某种意义上,是具有最小相对范数的插值网络)。尽管这一点对核化插值子已知,我们的证明直接适用于经 GD 训练的网络,而无须中间核化。同时,通过放宽此处发展的预言机不等式,我们以直接的方式恢复了现有的基于 NTK 的风险界,这表明我们的分析更紧。最后,与多数基于 NTK 的分析不同,我们关注带标签噪声的回归,并证明了早停的 GD 是一致的。

关键词

引用

@article{arxiv.2107.12723,
  title  = {Stability & Generalisation of Gradient Descent for Shallow Neural Networks without the Neural Tangent Kernel},
  author = {Dominic Richards and Ilja Kuzborskij},
  journal= {arXiv preprint arXiv:2107.12723},
  year   = {2021}
}

备注

Neurips 2021 camera ready