通用 Transformer
计算与语言
2019-03-06 v3 机器学习
机器学习
摘要
循环神经网络(RNN)通过用每个新数据点更新其状态来顺序处理数据,长期以来一直是序列建模任务的事实标准选择。然而,其固有的顺序计算使得训练缓慢。前馈与卷积架构近来被证明在一些序列建模任务(如机器翻译)上取得更优结果,并且具有可并发处理序列中所有输入的额外优势,从而易于并行化并加快训练。尽管有这些成功,流行的如 Transformer 的前馈序列模型在许多简单任务上无法泛化,而循环模型却能轻松处理,例如当字符串或公式长度超过训练时观测到的长度时复制字符串甚至简单逻辑推理。我们提出通用 Transformer(UT),一种时间并行、自注意力循环序列模型,可视为 Transformer 模型的推广,并解决了这些问题。UT 将 Transformer 等前馈序列模型的并行性与全局感受野同 RNN 的循环归纳偏置相结合。我们还添加了动态逐位置停止机制,并发现其在若干任务上提升了准确率。与标准 Transformer 不同,在某些假设下,UT 可被证明是图灵完备的。我们的实验表明,UT 在广泛的算法与语言理解任务上优于标准 Transformer,包括具有挑战性的 LAMBADA 语言建模任务(UT 达到了新的 SOTA),以及机器翻译(UT 在 WMT14 En-De 数据集上比 Transformer 提高了 0.9 BLEU)。
引用
@article{arxiv.1807.03819,
title = {Universal Transformers},
author = {Mostafa Dehghani and Stephan Gouws and Oriol Vinyals and Jakob Uszkoreit and Łukasz Kaiser},
journal= {arXiv preprint arXiv:1807.03819},
year = {2019}
}
备注
Published at ICLR2019