中文

空间结构化、时间随机化:在RNN中利用Dropout实现高效训练

机器学习 2021-06-24 v1 计算与语言 性能

摘要

循环神经网络(RNNs),更具体地其长短期记忆(LSTM)变体,已被广泛用作深度学习工具,用于处理文本和语音中基于序列的学习任务。由于隐藏状态计算对每个时间步重复进行的循环特性,此类LSTM应用的训练计算密集。尽管深度神经网络中的稀疏性已被广泛视为在训练和推理阶段减少计算时间的机会,但LSTM RNN中非ReLU激活的使用使得与神经元激活和梯度值相关的此类动态稀疏性机会受限或不存在。本工作中,我们确定LSTM中dropout诱导的稀疏性是一种合适的计算缩减模式。Dropout是一种广泛使用的正则化机制,在每次训练迭代中随机丢弃计算的神经元值。我们提议结构化dropout模式,通过在一个批次内丢弃相同的物理神经元集合,产生列(行)级隐藏状态稀疏性,这非常适于在通用SIMD硬件以及脉动阵列中运行时减少计算。我们在三个代表性NLP任务上开展实验:PTB数据集上的语言建模、使用IWSLT De-En和En-Vi数据集的基于OpenNMT的机器翻译,以及使用CoNLL-2003共享任务的命名实体识别序列标注。我们证明所提方法能将基于dropout的计算缩减转化为训练时间的减少,提升幅度为1.23倍至1.64倍,且不牺牲目标指标。

关键词

引用

@article{arxiv.2106.12089,
  title  = {Structured in Space, Randomized in Time: Leveraging Dropout in RNNs for Efficient Training},
  author = {Anup Sarma and Sonali Singh and Huaipan Jiang and Rui Zhang and Mahmut T Kandemir and Chita R Das},
  journal= {arXiv preprint arXiv:2106.12089},
  year   = {2021}
}