中文

过参数化神经网络自然梯度下降的快速收敛性

机器学习 2019-10-29 v2 机器学习

摘要

自然梯度下降已被证明能有效缓解神经网络优化中病态曲率的影响,但关于其收敛性质的理论认知甚少,尤其对于非线性网络。本工作中,我们首次分析了自然梯度下降在具有平方误差损失的非线性神经网络上的收敛速度。我们确定了两个保证从随机初始化高效收敛的条件:(1) 雅可比矩阵(网络对所有训练样本的输出关于参数的导数)具有满行秩;(2) 雅可比矩阵在初始化附近的小扰动下是稳定的。对于两层 ReLU 神经网络,我们证明了在输入非退化与过参数化的假设下,这两个条件在训练过程中始终成立。我们进一步将分析扩展到更一般的损失函数。最后,我们证明了近似自然梯度下降方法 K-FAC 在相同假设下也收敛到全局极小值,并给出了该收敛速度的界。

关键词

引用

@article{arxiv.1905.10961,
  title  = {Fast Convergence of Natural Gradient Descent for Overparameterized Neural Networks},
  author = {Guodong Zhang and James Martens and Roger Grosse},
  journal= {arXiv preprint arXiv:1905.10961},
  year   = {2019}
}

备注

NeurIPS 2019