Belebele 基准:一个含 122 种语言变体的并行阅读理解数据集
计算与语言
2024-10-03 v2 人工智能
机器学习
摘要
我们提出 Belebele,一个涵盖 122 种语言变体的多选机器阅读理解(MRC)数据集。该数据集显著扩展了自然语言理解(NLU)基准的语言覆盖,使得能够在高、中、低资源语言上评估文本模型。每个问题基于 Flores-200 数据集中的短段落,并有四个多选答案。这些问题经过精心筛选,以区分具有不同一般语言理解水平的模型。英语数据集本身已足够困难,足以挑战最先进的语言模型。作为完全并行数据集,它支持跨所有语言的模型性能直接比较。我们使用该数据集评估多语言掩码语言模型(MLMs)与大型语言模型(LLMs)的能力。我们给出了广泛的结果,并发现尽管以英语为中心的 LLMs 存在显著的跨语言迁移,但远小的、在均衡多语言数据上预训练的 MLMs 仍理解多得多的语言。我们还观察到,更大的词表规模与有意识的词表构建与低资源语言上的更好表现相关。总体而言,Belebele 为评估与分析 NLP 系统的多语言能力开辟了新途径。
引用
@article{arxiv.2308.16884,
title = {The Belebele Benchmark: a Parallel Reading Comprehension Dataset in 122 Language Variants},
author = {Lucas Bandarkar and Davis Liang and Benjamin Muller and Mikel Artetxe and Satya Narayan Shukla and Donald Husa and Naman Goyal and Abhinandan Krishnan and Luke Zettlemoyer and Madian Khabsa},
journal= {arXiv preprint arXiv:2308.16884},
year = {2024}
}
备注
ACL 2024