通过交替最小化学习 ReLU 网络
机器学习
2018-10-12 v2 机器学习
摘要
我们提出并分析了一类用于训练具有 ReLU 激活函数的神经网络的新算法族。我们的算法基于交替最小化技术:估计所有给定样本上每个 ReLU 的激活模式,并与通过最小二乘步骤的权重更新交替进行。我们论文的主要关注点是具有 个隐藏神经元和 ReLU 激活的 1-隐藏层网络。我们表明,在 维输入数据上的标准分布假设下,只要权重初始化足够好,我们的算法可证明以线性收敛方式恢复真实的“ ground truth”参数;此外,我们的方法仅需 个样本。我们还分析了具有跳跃连接的 1-隐藏层网络的特例,这类结构常用于 ResNet 型架构,并为其提出了一种新颖的初始化策略。对于基于 ReLU 的 ResNet 型网络,我们提供了首个端到端算法的线性收敛保证。我们还将此框架扩展到更深网络,并通过经验证明其收敛到全局最小值。
引用
@article{arxiv.1806.07863,
title = {Learning ReLU Networks via Alternating Minimization},
author = {Gauri Jagatap and Chinmay Hegde},
journal= {arXiv preprint arXiv:1806.07863},
year = {2018}
}