Unicoder:一种通过多跨语言任务预训练的通用语言编码器
计算与语言
2019-09-05 v2
摘要
我们提出 Unicoder,一种对不同语言不敏感的通用语言编码器。给定任意 NLP 任务,可用 Unicoder 以一种语言的训练数据训练模型,并直接应用于其他语言同一任务的输入。相较于 Multilingual BERT 与 XLM 等类似工作,我们提出三个新的跨语言预训练任务,包括跨语言词恢复、跨语言释义分类与跨语言掩码语言模型。这些任务帮助 Unicoder 从更多视角学习不同语言间的映射。我们还发现以多种语言联合微调可带来进一步提升。实验在两个任务上进行:跨语言自然语言推理(XNLI)与跨语言问答(XQA),其中 XLM 为我们的基线。在 XNLI 上取得 1.8% 的平均准确率提升(基于 15 种语言)。在 XQA(我们构建的新跨语言数据集)上取得 5.5% 的平均准确率提升(基于法语与德语)。
引用
@article{arxiv.1909.00964,
title = {Unicoder: A Universal Language Encoder by Pre-training with Multiple Cross-lingual Tasks},
author = {Haoyang Huang and Yaobo Liang and Nan Duan and Ming Gong and Linjun Shou and Daxin Jiang and Ming Zhou},
journal= {arXiv preprint arXiv:1909.00964},
year = {2019}
}
备注
Accepted to EMNLP2019; 10 pages, 2 figures