中文

h-detach:面向更优优化修改 LSTM 梯度

机器学习 2019-01-10 v2 机器学习

摘要

循环神经网络以其臭名昭著的梯度爆炸与消失问题(EVGP)而著称。在那些所需信息存在于长时间尺度上的任务中,该问题尤为明显,因为 EVGP 阻止了重要的梯度分量在大量时间步上被充分反向传播。我们引入了一种简单的随机算法(\textit{h}-detach),它专门针对 LSTM 优化并旨在解决该问题。具体而言,我们表明当 LSTM 权重较大时,LSTM 计算图中通过线性路径(单元状态)的梯度分量会受到抑制。基于这些分量携带关于长期依赖信息的假设(我们经实证展示),其受抑制会阻碍 LSTM 捕捉此类依赖。我们的算法\footnote{我们的代码见 https://github.com/bhargav104/h-detach.}防止流经该路径的梯度被抑制,从而让 LSTM 能更好地捕捉此类依赖。我们在多个基准数据集上,通过使用我们对 LSTM 梯度的修改,在收敛速度、对随机种子和学习率的鲁棒性以及泛化能力方面,展示了相较原始 LSTM 基于梯度的训练的显著改进。

关键词

引用

@article{arxiv.1810.03023,
  title  = {h-detach: Modifying the LSTM Gradient Towards Better Optimization},
  author = {Devansh Arpit and Bhargav Kanuparthi and Giancarlo Kerg and Nan Rosemary Ke and Ioannis Mitliagkas and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1810.03023},
  year   = {2019}
}

备注

First two authors contributed equally. Published in ICLR 2019