基于结构化数据随机梯度下降的过参数化神经网络学习
机器学习
2019-08-02 v3 机器学习
摘要
神经网络有许多成功应用,但理论理解却少得多。为缩小这一差距,我们研究了从随机初始化出发,通过随机梯度下降(SGD)学习用于多类分类的两层过参数化ReLU神经网络的问题。在过参数化设定下,当数据来自良好分离分布的混合时,我们证明SGD学习到的网络具有较小的泛化误差,尽管该网络有足够容量拟合任意标签。此外,该分析对神经网络学习的几个方面提供了有趣的见解,并可基于合成数据和MNIST数据集上的实证研究得到验证。
引用
@article{arxiv.1808.01204,
title = {Learning Overparameterized Neural Networks via Stochastic Gradient Descent on Structured Data},
author = {Yuanzhi Li and Yingyu Liang},
journal= {arXiv preprint arXiv:1808.01204},
year = {2019}
}
备注
NeurIPS'18 version. Appendix updated, additional experimental results added