adaQN:一种用于训练循环神经网络(RNNs)的自适应拟牛顿算法
机器学习
2016-02-25 v5 最优化与控制
机器学习
摘要
循环神经网络(Recurrent Neural Networks, RNNs)是强大的模型,在若干模式识别问题上取得卓越性能。然而,由于众所周知的“梯度消失/爆炸”问题,RNNs的训练是一项计算困难的任务。针对RNNs训练提出的算法要么利用极少(或有限)曲率信息且具有较低的每次迭代复杂度,要么试图以增加每次迭代代价为成本获取显著的曲率信息。前者包括对角缩放的一阶方法如ADAGRAD和ADAM,后者则由如Hessian-Free Newton和K-FAC等二阶算法组成。本文中,我们提出adaQN,一种用于训练RNNs的随机拟牛顿算法。我们的方法保持较低的每次迭代代价,同时通过随机L-BFGS更新方案实现非对角缩放。该方法采用一种新颖的L-BFGS缩放初始化方案,并在存储和保留L-BFGS曲率对方面审慎处理。我们在两个语言建模任务上给出了数值实验,表明adaQN与流行的RNN训练算法具有竞争力。
引用
@article{arxiv.1511.01169,
title = {adaQN: An Adaptive Quasi-Newton Algorithm for Training RNNs},
author = {Nitish Shirish Keskar and Albert S. Berahas},
journal= {arXiv preprint arXiv:1511.01169},
year = {2016}
}