中文

具有一个宽层后接金字塔拓扑的深度网络的全局收敛性

机器学习 2020-12-21 v3 机器学习

摘要

近期的研究表明,梯度下降可以为过参数化神经网络找到全局极小值,其中所有隐藏层的宽度都随 NNNN 为训练样本数)多项式地缩放。在本文中,我们证明对于深度网络,在输入层之后单个宽度为 NN 的层就足以保证类似的保证。特别地,所有其余层允许具有常数宽度,并形成金字塔拓扑。我们展示了我们的结果在广泛使用的 LeCun 初始化上的一个应用,并得到了该单个宽层的过参数化需求为 N2N^2 阶。

关键词

引用

@article{arxiv.2002.07867,
  title  = {Global Convergence of Deep Networks with One Wide Layer Followed by Pyramidal Topology},
  author = {Quynh Nguyen and Marco Mondelli},
  journal= {arXiv preprint arXiv:2002.07867},
  year   = {2020}
}

备注

Accepted at NeurIPS 2020