中文

两层神经网络全局优化器的理论性质

机器学习 2017-11-01 v1

摘要

在本文中,我们研究优化一个两层人工神经网络以最佳拟合训练数据集的问题。我们在参数数量大于采样点数量的设定下考察该问题。我们证明,对于一类广泛的微分激活函数(该类包含“几乎”所有非分段线性的函数),只要隐藏层非奇异,一阶最优解即满足全局最优性。我们的结果可容易地从方阵推广到由扁平矩阵给出的隐藏层。即使网络具有多于一个隐藏层,只要所有隐藏层满足非奇异性、所有激活函数来自给定的“良好”可微函数类且优化仅针对最后一层隐藏层,结果同样适用。我们还研究了目标函数的光滑性质,并证明它实际上是 Lipschitz 光滑的,即其梯度不会发生剧烈变化。我们利用光滑性质保证以 O(1/迭代次数) 的渐近收敛速度收敛到一阶最优解。我们还表明,我们的算法将在任意有限次迭代内保持隐藏层的非奇异性。

关键词

引用

@article{arxiv.1710.11241,
  title  = {Theoretical properties of the global optimizer of two layer neural network},
  author = {Digvijay Boob and Guanghui Lan},
  journal= {arXiv preprint arXiv:1710.11241},
  year   = {2017}
}