中文

R-Transformer:增强型循环神经网络的 Transformer

机器学习 2019-07-15 v1 计算与语言 计算机视觉与模式识别 音频与语音处理

摘要

循环神经网络长期以来一直是序列建模的主导选择。然而,它严重受制于两个问题:难以捕捉极长期依赖,且无法并行化顺序计算过程。因此,近期提出了许多基于卷积与注意力操作的非循环序列模型。值得注意的是,具有多头注意力的模型如 Transformer 已在多种序列建模任务中展现出捕捉长期依赖的极强有效性。尽管取得成功,这些模型缺乏建模序列局部结构的必要组件,且严重依赖位置嵌入,而位置嵌入效果有限且需要大量设计工作。本文提出 R-Transformer,其兼具 RNN 与多头注意力机制的优点,同时避免各自缺点。所提模型可在完全不使用位置嵌入的情况下有效捕捉序列中的局部结构与全局长期依赖。我们通过来自广泛领域的数据的大量实验评估 R-Transformer,实证结果表明其在大多数任务中以大幅优势优于最先进方法。我们已将代码公开于 \url{https://github.com/DSE-MSU/R-transformer}。

关键词

引用

@article{arxiv.1907.05572,
  title  = {R-Transformer: Recurrent Neural Network Enhanced Transformer},
  author = {Zhiwei Wang and Yao Ma and Zitao Liu and Jiliang Tang},
  journal= {arXiv preprint arXiv:1907.05572},
  year   = {2019}
}