中文

深度学习算法的景观

机器学习 2017-08-08 v2 机器学习 最优化与控制

摘要

本文通过理论分析深度神经网络经验风险向总体风险的收敛行为及其驻点与性质,研究其景观。对于 ll 层线性神经网络,我们证明其经验风险以速率 O(r2ldlog(l)/n)\mathcal{O}(r^{2l}\sqrt{d\log(l)}/\sqrt{n}) 一致收敛到总体风险,其中训练样本量为 nn,总权重维度为 dd,每层权重的幅度界为 rr。基于此结果,我们推导出经验风险的稳定性和泛化界。此外,我们建立了经验风险梯度向其总体对应物的一致收敛性。我们证明了经验风险与总体风险之间非退化驻点的一一对应关系,并带有收敛保证,这刻画了深度神经网络的景观。另外,我们分析了具有 sigmoid 激活函数的深度非线性神经网络的这些性质。我们证明了其经验风险及梯度的收敛行为的类似结果,并分析了其非退化驻点的性质。据我们所知,这项工作是首次从理论上刻画深度学习算法景观的工作。此外,我们的结果提供了训练良好深度神经网络所需的样本复杂度。我们还对神经网络深度 ll、层宽度、网络规模 dd 和参数幅度如何决定神经网络景观提供了理论理解。

关键词

引用

@article{arxiv.1705.07038,
  title  = {The Landscape of Deep Learning Algorithms},
  author = {Pan Zhou and Jiashi Feng},
  journal= {arXiv preprint arXiv:1705.07038},
  year   = {2017}
}