具有一个宽层后接金字塔拓扑的深度网络的全局收敛性
机器学习
2020-12-21 v3 机器学习
摘要
近期的研究表明,梯度下降可以为过参数化神经网络找到全局极小值,其中所有隐藏层的宽度都随 ( 为训练样本数)多项式地缩放。在本文中,我们证明对于深度网络,在输入层之后单个宽度为 的层就足以保证类似的保证。特别地,所有其余层允许具有常数宽度,并形成金字塔拓扑。我们展示了我们的结果在广泛使用的 LeCun 初始化上的一个应用,并得到了该单个宽层的过参数化需求为 阶。
引用
@article{arxiv.2002.07867,
title = {Global Convergence of Deep Networks with One Wide Layer Followed by Pyramidal Topology},
author = {Quynh Nguyen and Marco Mondelli},
journal= {arXiv preprint arXiv:2002.07867},
year = {2020}
}
备注
Accepted at NeurIPS 2020