赋能低资源语言检索:为乌尔都语 MS MARCO 建立基线
计算与语言
2025-04-07 v3 人工智能
信息检索
摘要
随着信息检索领域日益认识到包容性的重要性,满足低资源语言的需求仍然是一个重大挑战。本文通过机器翻译将 MS MARCO 数据集翻译成乌尔都语,首次引入了大规模乌尔都语信息检索数据集。我们通过零样本学习为乌尔都语信息检索建立了基线结果,随后将 mMARCO 多语言信息检索方法应用于这个新翻译的数据集。我们的研究结果表明,微调模型 (Urdu-mT5-mMARCO) 实现了平均倒数排名 (MRR@10) 为 0.247,召回率@10 为 0.439,相比零样本结果有显著提升,展示了扩大乌尔都语使用者信息检索访问的潜力。通过弥合低资源语言使用者的访问差距,这项工作不仅推动了多语言信息检索研究,还强调了包容性信息检索技术的伦理和社会重要性。这项工作为改善语言表征的挑战和解决方案提供了宝贵见解,并为未来研究奠定了基础,特别是南亚语言,这些语言可以受益于本研究中使用的适应性方法。
引用
@article{arxiv.2412.12997,
title = {Enabling Low-Resource Language Retrieval: Establishing Baselines for Urdu MS MARCO},
author = {Umer Butt and Stalin Varanasi and Günter Neumann},
journal= {arXiv preprint arXiv:2412.12997},
year = {2025}
}
备注
7 pages, ECIR 2025, conference camera-ready version