XLNet:用于语言理解的广义自回归预训练
计算与语言
2020-01-03 v2 机器学习
摘要
凭借对双向上下文建模的能力,基于去噪自编码的预训练方法(如BERT)比基于自回归语言建模的预训练方法表现更好。然而,BERT依赖于用掩码破坏输入,忽略了被掩码位置之间的依赖关系,并遭受预训练-微调不一致的问题。鉴于这些优缺点,我们提出XLNet,一种广义自回归预训练方法,其(1)通过最大化所有分解顺序排列的期望似然来学习双向上下文,(2)得益于其自回归形式,克服了BERT的局限。此外,XLNet将最先进自回归模型Transformer-XL的思想整合进预训练中。在经验上,在可比的实验设置下,XLNet在20项任务上超越BERT,且常有大幅领先,包括问答、自然语言推理、情感分析与文档排序。
引用
@article{arxiv.1906.08237,
title = {XLNet: Generalized Autoregressive Pretraining for Language Understanding},
author = {Zhilin Yang and Zihang Dai and Yiming Yang and Jaime Carbonell and Ruslan Salakhutdinov and Quoc V. Le},
journal= {arXiv preprint arXiv:1906.08237},
year = {2020}
}
备注
Pretrained models and code are available at https://github.com/zihangdai/xlnet