中文

大规模无监督跨语言表示学习

计算与语言 2020-04-09 v2

摘要

本文表明,大规模预训练多语言语言模型可为广泛的跨语言迁移任务带来显著的性能提升。我们在一个包含一百种语言的 Transformer 基掩码语言模型上进行训练,使用了超过两 TB 的过滤 CommonCrawl 数据。我们的模型称为 XLM-R,在多种跨语言基准上显著优于多语言 BERT(mBERT),包括在 XNLI 上平均准确率提升 +14.6%、在 MLQA 上平均 F1 分数提升 +13%、在 NER 上 F1 分数提升 +2.4%。XLM-R 在低资源语言上表现尤为出色,相比先前的 XLM 模型,斯瓦希里语在 XNLI 准确率上提升 15.7%,乌尔都语提升 11.4%。我们还对实现这些增益所需的关键因素进行了详细的实证分析,包括 (1) 正迁移与容量稀释之间以及 (2) 大规模下高资源与低资源语言性能之间的权衡。最后,我们首次展示了在不牺牲单语言性能的前提下进行多语言建模的可能性;XLM-R 在 GLUE 和 XNLI 基准上与强大的单语模型极具竞争力。我们将公开我们的代码、数据与模型。

关键词

引用

@article{arxiv.1911.02116,
  title  = {Unsupervised Cross-lingual Representation Learning at Scale},
  author = {Alexis Conneau and Kartikay Khandelwal and Naman Goyal and Vishrav Chaudhary and Guillaume Wenzek and Francisco Guzmán and Edouard Grave and Myle Ott and Luke Zettlemoyer and Veselin Stoyanov},
  journal= {arXiv preprint arXiv:1911.02116},
  year   = {2020}
}

备注

ACL 2020 (+ updated results)