用延迟循环神经网络近似堆叠与双向循环架构
机器学习
2020-06-19 v2 计算与语言
神经与进化计算
机器学习
摘要
近期研究表明,对循环神经网络(RNNs)的拓扑增强可提升其表达力与表征能力。两种流行的增强方式是堆叠RNN(增加学习非线性函数的能力)与双向处理(利用序列中的非因果信息)。本工作中,我们探究延迟RNN——一种在输入与输出间存在延迟的单层RNN。我们证明,带权值约束的延迟RNN等价于堆叠RNN。我们还表明,该延迟带来了部分非因果性,与双向网络十分相似。合成实验证实,延迟RNN可模仿双向网络,在部分非因果任务上表现相近,而在其他任务上优于它们。此外,我们在真实自然语言处理任务上展示了与双向网络相近的性能。这些结果表明,延迟RNN可近似包括堆叠RNN、双向RNN及堆叠双向RNN在内的拓扑结构——且延迟RNN具有等效或更短的运行时间。
引用
@article{arxiv.1909.00021,
title = {Approximating Stacked and Bidirectional Recurrent Architectures with the Delayed Recurrent Neural Network},
author = {Javier S. Turek and Shailee Jain and Vy Vo and Mihai Capota and Alexander G. Huth and Theodore L. Willke},
journal= {arXiv preprint arXiv:1909.00021},
year = {2020}
}
备注
to be published in Proceedings of International Conference on Machine Learning 2020 (ICML)