通过高斯门控 LSTM 减少状态更新
机器学习
2019-01-23 v1 机器学习
摘要
由于众所周知的梯度消失问题,循环神经网络在长序列数据上可能难以训练。一些架构采用减少 RNN 状态更新的方法,从而使网络能在长时程间隔上保持记忆。为解决这些收敛问题,本文提出一种时间门控的 LSTM RNN 模型,称为高斯门控 LSTM(g-LSTM)。时间门控制训练期间神经元何时可更新,实现更长的记忆保持与更好的误差梯度流动。该模型比 LSTM 更好地捕捉长时依赖,且时间门参数即使从非最优初始化值也能学习。由于时间门限制了神经元状态的更新,网络更新所需的计算量也得以减少。通过在训练损失中加入计算预算项,我们可获得进一步将计算量减少至少 10 倍的网络。最后,通过对 g-LSTM 采用时间课程学习调度,我们可缩短等效 LSTM 网络在长序列上的收敛时间。
引用
@article{arxiv.1901.07334,
title = {Reducing state updates via Gaussian-gated LSTMs},
author = {Matthew Thornton and Jithendar Anumula and Shih-Chii Liu},
journal= {arXiv preprint arXiv:1901.07334},
year = {2019}
}