中文

带 ReLU 激活的两层神经网络的收敛性分析

机器学习 2017-11-03 v2

摘要

近年来,基于随机梯度下降 (SGD) 的技术已成为训练神经网络的标准工具。然而,对于为什么 SGD 在实践中能够训练神经网络,目前仍缺乏形式化的理论理解。在本文中,我们通过提供 SGD 在具有 ReLU 激活的一大类两层前馈网络上的收敛分析,在理解这一奥秘方面取得了进展。该子集以被称为“恒等映射”的特殊结构为特征。我们证明,如果输入服从高斯分布,且权重采用标准的 O(1/d)O(1/\sqrt{d}) 初始化,则 SGD 能在多项式步数内收敛至全局最小值。与普通的原始网络不同,“恒等映射”使我们的网络具有非对称性,从而全局最小值是唯一的。作为理论的补充,我们还通过实验表明,具有此映射的多层网络比普通的原始网络具有更好的性能。我们的收敛定理不同于传统的非凸优化技术。我们表明 SGD 分“两阶段”收敛至最优:在第一阶段,梯度指向错误方向,但势函数 gg 逐渐减小;随后在第二阶段,SGD 进入一个良好的一点凸区域并实现收敛。我们还表明恒等映射对于收敛是必要的,因为它将初始点移至更利于优化的位置。实验验证了我们的主张。

关键词

引用

@article{arxiv.1705.09886,
  title  = {Convergence Analysis of Two-layer Neural Networks with ReLU Activation},
  author = {Yuanzhi Li and Yang Yuan},
  journal= {arXiv preprint arXiv:1705.09886},
  year   = {2017}
}