线性可分数据上 ReLU 网络的学习:算法、最优性与泛化
机器学习
2019-05-01 v2 信息论
机器学习
math.IT
最优化与控制
摘要
具有 ReLU(REctified Linear Unit,修正线性单元)激活函数的神经网络(又称 ReLU 网络)已在各领域取得巨大实证成功。尽管如此,现有关于学习 ReLU 网络的结果要么假设底层数据分布为例如高斯分布,要么要求网络规模及/或训练规模足够大。在此背景下,本文在二分类设定中研究双层 ReLU 网络的学习问题,其中数据线性可分且采用 hinge loss 准则。借助随机噪声扰动的力量,本文提出一种新颖的随机梯度下降(SGD)算法,该算法可证明地训练任意单隐层 ReLU 网络达到全局最优,尽管一般情况下存在无穷多个糟糕的局部极小、极大与鞍点。该结果属首创,无需对数据分布、训练/网络规模或初始化作任何假设。通过建立待执行非零更新次数的上界与下界,分析了所得迭代算法收敛至全局极小的情况。此外,利用经典压缩界为用该新颖 SGD 训练的 ReLU 网络给出了泛化保证。这些保证凸显了(至少在最坏情况下)在样本复杂度方面可靠学习 ReLU 网络与 leaky ReLU 网络之间的关键差异。使用合成数据与真实图像的数值测试验证了算法的有效性及该理论的实用价值。
引用
@article{arxiv.1808.04685,
title = {Learning ReLU Networks on Linearly Separable Data: Algorithm, Optimality, and Generalization},
author = {Gang Wang and Georgios B. Giannakis and Jie Chen},
journal= {arXiv preprint arXiv:1808.04685},
year = {2019}
}
备注
23 pages, 7 figures, work in progress