独立循环神经网络 (IndRNN):构建更长更深的 RNN
计算机视觉与模式识别
2019-10-15 v3 机器学习
摘要
循环神经网络 (RNN) 已广泛用于序列数据处理。然而,RNN 常因众所周知的梯度消失与爆炸问题而难以训练,且难以学习长期模式。长短期记忆 (LSTM) 与门控循环单元 (GRU) 被提出以解决这些问题,但双曲正切与 sigmoid 激活函数的使用导致梯度随层衰减。因此,构建可高效训练的深度网络颇具挑战。此外,RNN 层中所有神经元相互纠缠,其行为难以解释。为解决这些问题,本文提出一种新型 RNN,称为独立循环神经网络 (IndRNN),其中同层神经元彼此独立且跨层连接。我们已证明 IndRNN 可轻易调节以防止梯度爆炸与消失问题,同时使网络学习长期依赖。而且,IndRNN 可使用非饱和激活函数(如 relu(修正线性单元))仍稳健训练。多个 IndRNN 可堆叠以构建比现有 RNN 更深的网络。实验结果表明,所提 IndRNN 能处理极长序列(超过 5000 时间步),可用于构建极深网络(实验中用了 21 层)且仍稳健训练。相较于传统 RNN 与 LSTM,使用 IndRNN 在多项任务上取得了更优性能。代码见 https://github.com/Sunnydreamrain/IndRNN_Theano_Lasagne。
引用
@article{arxiv.1803.04831,
title = {Independently Recurrent Neural Network (IndRNN): Building A Longer and Deeper RNN},
author = {Shuai Li and Wanqing Li and Chris Cook and Ce Zhu and Yanbo Gao},
journal= {arXiv preprint arXiv:1803.04831},
year = {2019}
}
备注
CVPR 2018