学习深度 ReLU 网络需要多少过参数化?
机器学习
2022-01-03 v4 最优化与控制
机器学习
摘要
近期关于深度学习的一系列研究聚焦于极度过参数化的设定,并表明当网络宽度大于训练样本数 与目标误差倒数 的高次多项式时,通过(随机)梯度下降学习的深度神经网络具有良好的优化与泛化保证。最近有研究表明,在对训练数据作特定间隔假设下,两层 ReLU 网络仅需多对数宽度条件即可收敛并泛化(Ji and Telgarsky, 2019)。然而,深度神经网络是否能在如此温和的过参数化下被学习仍是一个开放问题。本文肯定地回答了该问题,并为(随机)梯度下降训练的深度 ReLU 网络建立了更紧的学习保证。具体而言,在先前工作的假设下,我们的优化与泛化保证在网络宽度关于 与 为多对数时即成立。我们的结果将过参数化深度神经网络的研究推向更实际的设定。
引用
@article{arxiv.1911.12360,
title = {How Much Over-parameterization Is Sufficient to Learn Deep ReLU Networks?},
author = {Zixiang Chen and Yuan Cao and Difan Zou and Quanquan Gu},
journal= {arXiv preprint arXiv:1911.12360},
year = {2022}
}
备注
21 pages, 1 figure, 1 table. In ICLR 2021