中文

宽深神经网络随机梯度下降的泛化界

机器学习 2019-11-13 v3 最优化与控制 机器学习

摘要

我们研究过参数化机制下深度神经网络(DNNs)的训练与泛化,其中网络宽度(即每层隐藏节点数)远大于训练数据点数。我们证明,用随机梯度下降(SGD)和随机初始化训练的足够宽的 ReLU 网络的期望 00-11 损失,可被该网络在初始化时梯度所诱导的随机特征模型的训练损失所界定,我们称之为神经切线随机特征(NTRF)模型。对于能被 NTRF 模型以足够小误差分类的数据分布,我们的结果给出了阶为 O~(n1/2)\tilde{\mathcal{O}}(n^{-1/2}) 且与网络宽度无关的泛化误差界。我们的结果比许多现有的过参数化神经网络泛化误差界更一般且更紧。此外,我们建立了我们的泛化误差界与近期工作中提出的神经切线核(NTK)之间的强联系。

关键词

引用

@article{arxiv.1905.13210,
  title  = {Generalization Bounds of Stochastic Gradient Descent for Wide and Deep Neural Networks},
  author = {Yuan Cao and Quanquan Gu},
  journal= {arXiv preprint arXiv:1905.13210},
  year   = {2019}
}

备注

25 pages, 1 figure. In NeurIPS 2019