SIB-200:一个用于200余种语言与方言主题分类的简单、包容且大规模的评估数据集
计算与语言
2024-03-08 v3
摘要
尽管过去几年多语言自然语言处理取得了进展,但评估通常局限于少数具有可用数据集的语言,排除了大量低资源语言。本文创建了SIB-200——一个用于200种语言和方言主题分类的大规模开源基准数据集,以解决自然语言理解(NLU)评估数据集的缺失问题。对于SIB-200涵盖的许多语言,这是首个公开可用的NLU评估数据集。该数据集基于Flores-200机器翻译语料库。我们标注了数据集的英文部分,并将句子级标注扩展到语料库涵盖的其余203种语言。尽管该任务简单,我们在全监督设置、跨语言迁移设置以及大语言模型提示设置下的评估表明,当多语言评估扩展到众多世界语言时,高资源与低资源语言之间的性能差距仍然很大。我们发现,多语言语言模型预训练期间未见过、代表性不足的语言族(如Nilotic和Altantic-Congo)以及来自非洲、美洲、大洋洲和东南亚地区的语言,在我们的主题分类数据集上往往性能最低。我们希望本数据集能鼓励对多语言语言模型在更多样语言集合上进行更具包容性的评估。https://github.com/dadelani/sib-200
引用
@article{arxiv.2309.07445,
title = {SIB-200: A Simple, Inclusive, and Big Evaluation Dataset for Topic Classification in 200+ Languages and Dialects},
author = {David Ifeoluwa Adelani and Hannah Liu and Xiaoyu Shen and Nikita Vassilyev and Jesujoba O. Alabi and Yanke Mao and Haonan Gao and Annie En-Shiun Lee},
journal= {arXiv preprint arXiv:2309.07445},
year = {2024}
}
备注
Accepted to EACL 2024 (main conference)