中文

神经网络训练中的局部极小

机器学习 2017-02-20 v2 机器学习 神经与进化计算

摘要

近期,刻画深度模型误差曲面的尝试引起了大量关注。这源于一个长期存在的问题。鉴于深度网络是由局部梯度方法优化的高度非线性系统,为何它们似乎不受糟糕局部极小的影响?人们广泛认为,使用梯度方法训练深度模型之所以效果良好,是因为误差曲面要么没有局部极小,要么若存在则其在值上需接近全局极小。已知此类结果在非常强的假设下成立,而真实模型并不满足这些假设。本文中,我们给出示例表明,要使此类定理成立,必须对数据、初始化方案和/或模型类做出额外假设。我们考察有限规模数据集这一特例。我们证明,在此情形下可以构造反例(数据集或初始化方案),使得网络在权重空间上确实易受糟糕局部极小的影响。

关键词

引用

@article{arxiv.1611.06310,
  title  = {Local minima in training of neural networks},
  author = {Grzegorz Swirszcz and Wojciech Marian Czarnecki and Razvan Pascanu},
  journal= {arXiv preprint arXiv:1611.06310},
  year   = {2017}
}