Transformer-XL:超越固定长度上下文的注意力语言模型
机器学习
2019-06-04 v3 计算与语言
机器学习
摘要
Transformer 具有学习更长程依赖的潜力,但在语言建模设定中受限于固定长度上下文。我们提出一种新颖神经架构 Transformer-XL,其能够学习超出固定长度的依赖而不破坏时间连贯性。它由段级递归机制与新颖位置编码方案组成。我们的方法不仅可捕获更长程依赖,还解决了上下文碎片化问题。结果,Transformer-XL 学习的依赖比 RNN 长 80%、比原始 Transformer 长 450%,在短序列与长序列上均取得更优性能,且在评估时比原始 Transformer 快达 1,800 倍以上。值得注意的是,我们将 bpc/困惑度的 state-of-the-art 结果提升至 enwiki8 上 0.99、text8 上 1.08、WikiText-103 上 18.3、One Billion Word 上 21.8、以及 Penn Treebank 上 54.5(无微调)。当仅在 WikiText-103 上训练时,Transformer-XL 能够生成具有数千 token、相当连贯新颖的文本文章。我们的代码、预训练模型与超参数在 Tensorflow 与 PyTorch 中均可用。
引用
@article{arxiv.1901.02860,
title = {Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context},
author = {Zihang Dai and Zhilin Yang and Yiming Yang and Jaime Carbonell and Quoc V. Le and Ruslan Salakhutdinov},
journal= {arXiv preprint arXiv:1901.02860},
year = {2019}
}
备注
ACL 2019 long paper. Code and pretrained models are available at https://github.com/kimiyoung/transformer-xl