用于非凸优化的均衡自适应学习率
机器学习
2015-09-01 v2 数值分析
摘要
针对特定参数的自适应学习率方法是减少训练大型深度网络时遇到的病态问题的计算高效途径。继最近强烈表明训练此类网络时遇到的大多数临界点均为鞍点的工作之后,我们发现考虑 Hessian 矩阵负特征值的存在有助于设计更合适的自适应学习率方案。我们展示了流行的 Jacobi 预条件子在同时存在正曲率和负曲率时具有不良行为,并提供了理论和实证证据,表明所谓的均衡预条件子更适合非凸问题。我们引入了一种基于均衡预条件子的新型自适应学习率方案,称为 ESGD。我们的实验表明,ESGD 在收敛速度方面表现与 RMSProp 相当或更好,且始终明显优于普通的随机梯度下降。
引用
@article{arxiv.1502.04390,
title = {Equilibrated adaptive learning rates for non-convex optimization},
author = {Yann N. Dauphin and Harm de Vries and Yoshua Bengio},
journal= {arXiv preprint arXiv:1502.04390},
year = {2015}
}