中文

XNLI 2.0:改进 XNLI 数据集及跨语言理解(XLU)性能

计算与语言 2023-01-18 v1 机器学习

摘要

自然语言处理系统严重依赖于标注数据的可用性以训练实用模型。起初,模型主要在英文数据集上训练。近年来,由于在不同语言中工作的迫切需求急剧增长,多语言理解取得了显著进展。其中突出的一点在于,既然现在有如此多的多语言预训练模型,我们可以利用它们来完成跨语言理解任务。借助跨语言理解和自然语言推理,可以训练出应用超越训练语言范围的模型。我们能够利用机器翻译的力量,跳过将数据集从一种语言翻译到另一种语言的繁琐环节。在这项工作中,我们专注于通过重新翻译 MNLI 数据集来改进原始的 XNLI 数据集,涵盖 XNLI 中全部14种不同语言,包括使用 Google 翻译的 XNLI 测试集和开发集。我们还通过在全部15种语言中训练模型并分析其在自然语言推理任务上的性能来进行实验。随后我们将边界扩展,探究是否可以通过在英语以外的语言中训练模型来提升斯瓦希里语和乌尔都语等低资源语言的性能。

关键词

引用

@article{arxiv.2301.06527,
  title  = {XNLI 2.0: Improving XNLI dataset and performance on Cross Lingual Understanding (XLU)},
  author = {Ankit Kumar Upadhyay and Harsit Kumar Upadhya},
  journal= {arXiv preprint arXiv:2301.06527},
  year   = {2023}
}