中文

XTREME:用于评估跨语言泛化的海量多语言多任务基准

计算与语言 2020-09-07 v5 机器学习

摘要

机器学习模型在 NLP 应用中的许多近期进展由在广泛任务上评估模型的基准所推动。然而,这些广覆盖基准大多局限于英语,并且尽管对多语言模型的兴趣日益增长,仍缺少一个能够在多样化语言和任务上全面评估此类方法的基准。为此,我们引入跨语言迁移评估多语言编码器 XTREME 基准,一个用于评估多语言表示在 40 种语言和 9 项任务上跨语言泛化能力的多任务基准。我们表明,尽管在英语上测试的模型在许多任务上达到人类水平,跨语言迁移模型的性能仍存在显著差距,尤其在句法和句子检索任务上。不同语言间的结果也存在广泛差异。我们发布该基准以鼓励在跨语言学习方法上的研究,这些方法在多样且具有代表性的语言和任务间迁移语言知识。

关键词

引用

@article{arxiv.2003.11080,
  title  = {XTREME: A Massively Multilingual Multi-task Benchmark for Evaluating Cross-lingual Generalization},
  author = {Junjie Hu and Sebastian Ruder and Aditya Siddhant and Graham Neubig and Orhan Firat and Melvin Johnson},
  journal= {arXiv preprint arXiv:2003.11080},
  year   = {2020}
}

备注

In Proceedings of the 37th International Conference on Machine Learning (ICML). July 2020