无需时间回溯的长距离依赖:提升稀疏预测自编码器在序列建模中的性能
机器学习
2019-12-04 v1 计算与语言
神经与进化计算
机器学习
摘要
在语言建模等序列学习任务中,循环神经网络必须学习由时间分隔的输入特征之间的关系。诸如LSTM和Transformer等最先进的模型通过将对损失的反向传播作用于保存在内存中的先前隐藏状态和输入来进行训练。这使得梯度能够从当前流向过去,并以完美的后见之明有效学习,但代价是显著的内存开销。在本文中,我们展示可以使用时间上局部的信息训练高性能循环网络,从而显著减少内存占用。我们描述了一种称为bRSM的预测自编码器,其具有循环连接、稀疏激活以及用于改善单元利用率的提升规则。该架构在由高马尔可夫阶MNIST数字序列组成的非确定性(随机)部分可观测序列学习任务上展现出近乎最优的性能。我们发现该模型比LSTM更快更完整地学习这些序列,并提供了几种关于LSTM架构在此任务中可能难以应对部分可观测序列结构的解释。我们还将我们的模型应用于Penn Treebank(PTB)数据集上的下一词预测任务。我们展示了一个“扁平化”的RSM网络,当与现代语义词嵌入以及提升机制结合时,达到了103.5 PPL(比最佳N-gram模型提升20个点),超越了使用BPTT训练的普通RNN,并接近早期LSTM实现的分数。本工作提供了令人鼓舞的证据,表明在语言建模等具有挑战性的任务上,使用内存密集度更低、生物学上合理的训练机制也可能取得强劲结果。
引用
@article{arxiv.1912.01116,
title = {Long Distance Relationships without Time Travel: Boosting the Performance of a Sparse Predictive Autoencoder in Sequence Modeling},
author = {Jeremy Gordon and David Rawlinson and Subutai Ahmad},
journal= {arXiv preprint arXiv:1912.01116},
year = {2019}
}
备注
9 pages, 6 figures, 4 tables