中文

通过交替最小化学习 ReLU 网络

机器学习 2018-10-12 v2 机器学习

摘要

我们提出并分析了一类用于训练具有 ReLU 激活函数的神经网络的新算法族。我们的算法基于交替最小化技术:估计所有给定样本上每个 ReLU 的激活模式,并与通过最小二乘步骤的权重更新交替进行。我们论文的主要关注点是具有 kk 个隐藏神经元和 ReLU 激活的 1-隐藏层网络。我们表明,在 dd 维输入数据上的标准分布假设下,只要权重初始化足够好,我们的算法可证明以线性收敛方式恢复真实的“ ground truth”参数;此外,我们的方法仅需 n=O~(dk2)n=\widetilde{O}(dk^2) 个样本。我们还分析了具有跳跃连接的 1-隐藏层网络的特例,这类结构常用于 ResNet 型架构,并为其提出了一种新颖的初始化策略。对于基于 ReLU 的 ResNet 型网络,我们提供了首个端到端算法的线性收敛保证。我们还将此框架扩展到更深网络,并通过经验证明其收敛到全局最小值。

关键词

引用

@article{arxiv.1806.07863,
  title  = {Learning ReLU Networks via Alternating Minimization},
  author = {Gauri Jagatap and Chinmay Hegde},
  journal= {arXiv preprint arXiv:1806.07863},
  year   = {2018}
}