XLM-K:利用多语言知识改进跨语言语言模型预训练
计算与语言
2022-04-26 v3
摘要
跨语言预训练在使用单语和双语纯文本语料库方面取得了巨大成功。然而,大多数预训练模型忽略了多语言知识,这些知识虽与语言无关,但包含丰富的跨语言结构对齐信息。本文提出 XLM-K,一种在预训练中融入多语言知识的跨语言语言模型。XLM-K 通过两个知识任务——掩码实体预测任务和对象蕴含任务——来增强现有的多语言预训练。我们在 MLQA、NER 和 XNLI 上评估了 XLM-K。实验结果清楚地表明,相比现有的多语言语言模型有显著改进。MLQA 和 NER 上的结果展示了 XLM-K 在知识相关任务中的优越性。XNLI 上的成功表明 XLM-K 获得了更好的跨语言迁移能力。此外,我们提供了详细的探测分析,以确认我们的预训练方案捕获了所需的知识。代码可在 https://github.com/microsoft/Unicoder/tree/master/pretraining/xlmk 获取。
引用
@article{arxiv.2109.12573,
title = {XLM-K: Improving Cross-Lingual Language Model Pre-training with Multilingual Knowledge},
author = {Xiaoze Jiang and Yaobo Liang and Weizhu Chen and Nan Duan},
journal= {arXiv preprint arXiv:2109.12573},
year = {2022}
}
备注
AAAI-2022