中文

重新审视深度网络的自然梯度

机器学习 2014-02-18 v7 数值分析

摘要

我们评估了自然梯度——一种最初由 Amari (1997) 提出的算法——在学习深度模型中的应用。本文的贡献如下。我们展示了自然梯度与最近提出的三种深度模型训练方法之间的联系:Hessian-Free (Martens, 2010)、Krylov Subspace Descent (Vinyals and Povey, 2012) 和 TONGA (Le Roux et al., 2008)。我们描述了如何使用无标签数据来改善自然梯度获得的泛化误差,并实证评估了与随机梯度下降相比,该算法对训练集顺序的鲁棒性。最后,我们将自然梯度扩展为在流形信息之外结合二阶信息,并使用截断牛顿法来求逆度量矩阵,而非使用其对角近似,从而为该新算法提供了基准测试。

关键词

引用

@article{arxiv.1301.3584,
  title  = {Revisiting Natural Gradient for Deep Networks},
  author = {Razvan Pascanu and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1301.3584},
  year   = {2014}
}