XTREME-R:迈向更具挑战性与细致化的多语言评测
计算与语言
2021-10-08 v2 人工智能
摘要
过去一年,机器学习在多语言自然语言处理能力上取得了惊人进展。例如,最新技术已将 XTREME 多语言基准上的最优性能提升了超过 13 个点。尽管距离人类水平性能仍有相当差距,但在某些任务上取得改进比在其他任务上更容易。本文分析了跨语言迁移学习的现状并总结了若干经验教训。为催化有意义的进展,我们将 XTREME 扩展为 XTREME-R,其包含一组改进的十个自然语言理解任务,包括具有挑战性的语言无关检索任务,并覆盖 50 种类型多样的语言。此外,我们提供了一个大规模多语言诊断套件(MultiCheckList)以及通过交互式公开排行榜实现的细粒度多数据集评测能力,以更好地理解此类模型。XTREME-R 的排行榜和代码将分别发布于 https://sites.research.google/xtreme 和 https://github.com/google-research/xtreme。
引用
@article{arxiv.2104.07412,
title = {XTREME-R: Towards More Challenging and Nuanced Multilingual Evaluation},
author = {Sebastian Ruder and Noah Constant and Jan Botha and Aditya Siddhant and Orhan Firat and Jinlan Fu and Pengfei Liu and Junjie Hu and Dan Garrette and Graham Neubig and Melvin Johnson},
journal= {arXiv preprint arXiv:2104.07412},
year = {2021}
}
备注
EMNLP 2021 camera-ready