中文

预测以含噪梯度训练的有限宽深度神经网络的输出

机器学习 2021-12-15 v3 无序系统与神经网络 统计力学 机器学习 神经与进化计算

摘要

近期一系列工作通过将宽深度神经网络(DNN)近似为高斯过程(GP)来研究它们。已有研究表明,以梯度流训练的DNN对应于由神经切线核(NTK)支配的GP,而更早的工作表明,权重具有独立同分布先验的DNN对应于所谓的神经网络高斯过程(NNGP)。此处我们考虑一种涉及噪声、权重衰减和有限宽的DNN训练协议,其结果对应于某种非高斯随机过程。随后引入一个解析框架来分析该非高斯过程,其与GP的偏离由有限宽控制。我们的贡献有三方面:(i) 在无限宽极限下,我们建立了以含噪梯度训练的DNN与NNGP(而非NTK)之间的对应。(ii) 我们给出了任意激活函数和深度的DNN的有限宽修正(FWC)的一般解析形式,并用它高精度地预测经验有限网络的输出。分析FWC作为训练集大小nn的函数行为,我们发现其在极小nn区间以及令人惊讶地在大nn区间(其中GP误差按O(1/n)O(1/n)缩放)均可忽略。(iii) 我们从代数上详述了这些FWC如何提升有限卷积神经网络(CNN)相对于其GP对应物在图像分类任务上的性能。

关键词

引用

@article{arxiv.2004.01190,
  title  = {Predicting the outputs of finite deep neural networks trained with noisy gradients},
  author = {Gadi Naveh and Oded Ben-David and Haim Sompolinsky and Zohar Ringel},
  journal= {arXiv preprint arXiv:2004.01190},
  year   = {2021}
}

备注

8 pages + appendix, 7 figures overall