过参数化两层神经网络的优化与泛化的细粒度分析
机器学习
2019-05-28 v2 神经与进化计算
机器学习
摘要
近期的工作在一定程度上揭示了为何深度网络能拟合任意数据并在极度过参数化下仍具有泛化能力这一谜题。本文分析了一个具有随机初始化的简单 2 层 ReLU 网络的训练与泛化,并在近期工作基础上给出如下改进:(i) 使用比近期论文更紧的训练速度刻画,解释了为何用随机标签训练神经网络会导致更慢的训练,正如 [Zhang et al. ICLR'17] 最初所观测到的那样。(ii) 独立于网络规模的泛化界,使用了一种数据相关的复杂度度量。我们的度量能清晰区分 MNIST 和 CIFAR 上的随机标签与真实标签,如实验所示。此外,近期论文要求样本复杂度(缓慢地)随规模增大,而我们的样本复杂度完全独立于网络规模。(iii) 通过梯度下降训练的两层 ReLU 网络对一大类光滑函数的可学习性。关键思想是通过一个相关核的性质来追踪训练与泛化的动力学。
引用
@article{arxiv.1901.08584,
title = {Fine-Grained Analysis of Optimization and Generalization for Overparameterized Two-Layer Neural Networks},
author = {Sanjeev Arora and Simon S. Du and Wei Hu and Zhiyuan Li and Ruosong Wang},
journal= {arXiv preprint arXiv:1901.08584},
year = {2019}
}
备注
In ICML 2019