中文

重温门控:可训练的深度多层 RNN

计算机视觉与模式识别 2021-03-09 v4 机器学习

摘要

我们为循环神经网络(RNNs)提出一种新的可堆叠循环单元(STAR),它比广泛使用的 LSTM 和 GRU 参数更少,同时对梯度消失或爆炸更具鲁棒性。将循环单元堆叠为深度架构有两个主要局限:(i)许多循环单元(如 LSTMs)在参数和计算资源上代价高昂;(ii)深度 RNNs 在训练期间容易出现梯度消失或爆炸。我们研究了多层 RNN 的训练,并考察了梯度在“垂直”方向通过网络传播时的大小。我们表明,取决于基本循环单元的结构,梯度会被系统性地衰减或放大。基于我们的分析,我们设计了一种能更好保持梯度大小的新门控单元。我们在大量序列建模任务上验证了我们的设计,并证明所提出的 STAR 单元允许构建和训练更深的循环架构,最终在性能提升的同时计算更高效。

关键词

引用

@article{arxiv.1911.11033,
  title  = {Gating Revisited: Deep Multi-layer RNNs That Can Be Trained},
  author = {Mehmet Ozgur Turkoglu and Stefano D'Aronco and Jan Dirk Wegner and Konrad Schindler},
  journal= {arXiv preprint arXiv:1911.11033},
  year   = {2021}
}

备注

To appear in TPAMI (accepted March 2021)