中文

梯度下降学习单隐藏层CNN:不必畏惧伪局部极小值

机器学习 2018-06-18 v2 人工智能 计算机视觉与模式识别 最优化与控制 机器学习

摘要

我们考虑学习一个具有非重叠卷积层和ReLU激活的单隐藏层神经网络,即 f(Z,w,a)=jajσ(wTZj)f(\mathbf{Z}, \mathbf{w}, \mathbf{a}) = \sum_j a_j\sigma(\mathbf{w}^T\mathbf{Z}_j),其中卷积权重 w\mathbf{w} 和输出权重 a\mathbf{a} 均为待学习参数。当标签来自具有相同架构且权重 (w,a)(\mathbf{w}^*, \mathbf{a}^*) 固定的教师网络时,我们证明在高斯输入 Z\mathbf{Z} 下存在一个伪局部极小值。令人惊讶的是,尽管存在该伪局部极小值,从随机初始化权重出发并带权重归一化的梯度下降仍可被证明以恒定概率恢复真实参数,且可通过多次重启将概率提升至 11。我们还表明,以恒定概率同样的流程也可能收敛到该伪局部极小值,说明局部极小值在梯度下降动态中起着非平凡作用。此外,定量分析与表明梯度下降动态分为两个阶段:起始较慢,但在若干次迭代后收敛显著加快。

关键词

引用

@article{arxiv.1712.00779,
  title  = {Gradient Descent Learns One-hidden-layer CNN: Don't be Afraid of Spurious Local Minima},
  author = {Simon S. Du and Jason D. Lee and Yuandong Tian and Barnabas Poczos and Aarti Singh},
  journal= {arXiv preprint arXiv:1712.00779},
  year   = {2018}
}

备注

Accepted by ICML 2018