中文

XGLUE:用于跨语言预训练、理解与生成的新基准数据集

计算与语言 2020-05-25 v3

摘要

本文介绍XGLUE,这是一个新的基准数据集,可用于利用多语言与双语语料训练大规模跨语言预训练模型,并评估其在多样化跨语言任务上的表现。相较于仅针对自然语言理解任务以英文标注的GLUE(Wang et al., 2019),XGLUE具有两大主要优势:(1)提供涵盖自然语言理解与生成场景的11项多样化任务;(2)每项任务均提供多语言标注数据。我们将近期的跨语言预训练模型Unicoder(Huang et al., 2019)扩展以覆盖理解与生成任务,并在XGLUE上作为强基线进行评估。我们还评估了Multilingual BERT、XLM和XLM-R的基础版本(12层)以作比较。

关键词

引用

@article{arxiv.2004.01401,
  title  = {XGLUE: A New Benchmark Dataset for Cross-lingual Pre-training, Understanding and Generation},
  author = {Yaobo Liang and Nan Duan and Yeyun Gong and Ning Wu and Fenfei Guo and Weizhen Qi and Ming Gong and Linjun Shou and Daxin Jiang and Guihong Cao and Xiaodong Fan and Ruofei Zhang and Rahul Agrawal and Edward Cui and Sining Wei and Taroon Bharti and Ying Qiao and Jiun-Hung Chen and Winnie Wu and Shuguang Liu and Fan Yang and Daniel Campos and Rangan Majumder and Ming Zhou},
  journal= {arXiv preprint arXiv:2004.01401},
  year   = {2020}
}