Hindi-BEIR:大规模印地语检索基准测试
信息检索
2024-08-20 v1 计算与语言
摘要
鉴于全球印地语使用者的庞大数量,对稳健高效的印地语信息检索系统存在迫切需求。尽管研究持续进行,但目前仍缺乏评估印地语检索模型的综合性基准。为填补这一空白,我们推出了 BEIR 基准测试的印地语版本,其中包括翻译为印地语的英文 BEIR 数据子集、现有印地语检索数据集以及为检索而合成的数据集。该基准涵盖跨越 8 个不同任务的 15 个数据集。我们在该基准上评估最先进的多元检索模型,以识别任务和领域特定的挑战及其对检索性能的影响。通过发布该基准和一组相关基线,我们使研究人员能够理解当前印地语检索模型的局限性与能力,促进这一关键领域的进步。Hindi-BEIR 的数据集公开发布。
引用
@article{arxiv.2408.09437,
title = {Hindi-BEIR : A Large Scale Retrieval Benchmark in Hindi},
author = {Arkadeep Acharya and Rudra Murthy and Vishwajeet Kumar and Jaydeep Sen},
journal= {arXiv preprint arXiv:2408.09437},
year = {2024}
}