中文

梯度下降能在分类问题上学习较少过参数化的两层神经网络

机器学习 2020-03-19 v3 机器学习

摘要

近来,若干研究证明了梯度下降方法对两层ReLU网络的全局收敛和泛化能力。大多数研究特别关注带平方损失函数的回归问题,除少数外,并且指出了神经正切核正性的重要性。另一方面,使用对数损失函数的分类问题上梯度下降的性能尚未得到充分研究,且对该问题结构的进一步探究是可能的。在本文中,我们证明了使用神经正切模型的可分性假设比神经正切核的正性条件更合理,并给出了带光滑激活的两层网络梯度下降的精细化收敛分析。我们结果的一个显著点是,与相关研究相比,我们的收敛和泛化界对网络宽度的依赖要好得多。因此,我们的理论为较少过参数化的两层网络提供了泛化保证,而大多数研究要求高得多的过参数化。

关键词

引用

@article{arxiv.1905.09870,
  title  = {Gradient Descent can Learn Less Over-parameterized Two-layer Neural Networks on Classification Problems},
  author = {Atsushi Nitanda and Geoffrey Chinot and Taiji Suzuki},
  journal= {arXiv preprint arXiv:1905.09870},
  year   = {2020}
}

备注

29 pages