构建 MIRACL:跨连续语言谱的多语言信息检索
信息检索
2022-10-19 v1 计算与语言
摘要
MIRACL(Multilingual Information Retrieval Across a Continuum of Languages,跨连续语言谱的多语言信息检索)是我们为 WSDM 2023 Cup 挑战赛构建的多语言数据集,聚焦于跨越 18 种不同语言的即席检索,这些语言合计涵盖全球超过三十亿母语者。这些语言具有多样的类型学,源自许多不同的语系,并关联着数量不等的可用资源——包括研究人员通常刻画为高资源以及低资源的语言。我们的数据集旨在支持单语检索模型的创建与评估,其中查询与语料库为同一语言。总计,我们针对这 18 种语言中的约 77k 条查询、基于 Wikipedia 收集了超过 700k 条高质量相关性判断,所有评估均由我们团队雇佣的母语者完成。我们的目标是刺激能改善跨连续语言谱检索的研究,从而增强全球不同人群的信息获取能力,特别是那些传统上未被充分服务的人群。本概述论文描述了我们与社区共享的数据集与基线。MIRACL 网站现位于 http://miracl.ai/。
引用
@article{arxiv.2210.09984,
title = {Making a MIRACL: Multilingual Information Retrieval Across a Continuum of Languages},
author = {Xinyu Zhang and Nandan Thakur and Odunayo Ogundepo and Ehsan Kamalloo and David Alfonso-Hermelo and Xiaoguang Li and Qun Liu and Mehdi Rezagholizadeh and Jimmy Lin},
journal= {arXiv preprint arXiv:2210.09984},
year = {2022}
}