中文

IndicIRSuite:面向印度语言的多语言数据集与神经信息检索模型

信息检索 2023-12-18 v1 计算与语言

摘要

在本文中,我们为来自两大印度语系(印度-雅利安语系和达罗毗荼语系)的 11 种广泛使用的印度语言(阿萨姆语、孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、奥里亚语、旁遮普语、泰米尔语和泰卢固语)引入了神经信息检索资源。这些资源包括: 使用机器翻译创建的 11 种印度语言版本的 MSMARCO 数据集 INDIC-MARCO; 包含 11 个独立单语神经信息检索模型的集合 Indic-ColBERT,每个模型均在 INDIC-MARCO 数据集中 11 种语言之一上进行了训练。据我们所知,IndicIRSuite 是首次尝试为大量印度语言构建大规模神经信息检索资源,我们希望它将有助于加速印度语言的神经信息检索研究。实验表明,除奥里亚语外,Indic-ColBERT 在所有 11 种印度语言的 INDIC-MARCO 基线上平均 MRR@10 得分提高了 47.47%,在 MIRACL 孟加拉语和印地语基线上平均 NDCG@10 得分提高了 12.26%,在 Mr.Tydi 孟加拉语基线上 MRR@100 得分提高了 20%。IndicIRSuite 可在 https://github.com/saifulhaq95/IndicIRSuite 获取

关键词

引用

@article{arxiv.2312.09508,
  title  = {IndicIRSuite: Multilingual Dataset and Neural Information Models for Indian Languages},
  author = {Saiful Haq and Ashutosh Sharma and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2312.09508},
  year   = {2023}
}