TransfoRNN:在自注意力表示中捕获序列信息用于语言建模
计算与语言
2021-04-06 v1
摘要
在本文中,我们描述了利用循环神经网络从自注意力表示中捕获序列信息以改进 Transformer。尽管自注意力机制提供了一种利用长上下文的手段,但序列信息(即词元的排列)并未被显式捕获。我们提出将循环神经网络级联到 Transformer 上,称为 TransfoRNN 模型,以捕获序列信息。我们发现,仅由浅层 Transformer 堆叠构成的 TransfoRNN 模型足以给出与更深 Transformer 模型相当(甚至更优)的性能。在 Penn Treebank 与 WikiText-2 语料库上评估,所提出的 TransfoRNN 模型以更少的模型参数量展现了更低的模型困惑度。在 Penn Treebank 语料库上,模型困惑度降低达 5.5%,模型规模缩小达 10.5%。在 WikiText-2 语料库上,模型困惑度降低达 2.2%,模型缩小 27.7%。此外,TransfoRNN 模型应用于 LibriSpeech 语音识别任务,并展现出与 Transformer 模型相当的结果。
引用
@article{arxiv.2104.01572,
title = {TransfoRNN: Capturing the Sequential Information in Self-Attention Representations for Language Modeling},
author = {Tze Yuang Chong and Xuyang Wang and Lin Yang and Junjie Wang},
journal= {arXiv preprint arXiv:2104.01572},
year = {2021}
}
备注
INTERSPEECH 2021 (under reviewed)