CURE:乌尔都语信息检索评估与排序语料库
信息检索
2020-11-03 v1
摘要
乌尔都语是一种广泛使用的语言,全球使用者达 1.63 亿。由于其丰富的形态特征和大量使用者,乌尔都语的信息检索(IR)需要研究界的特别关注。总体而言,乌尔都语的 IR 评估任务尚未得到充分探索。最为缺失的关键要素是缺乏针对乌尔都语的标准化评估语料库。在本研究中,我们提出并构建了一个用于 IR 评估的乌尔都语文档标准测试集,并将其命名为乌尔都语检索评估语料库(CURE)。我们使用两种 IR 模型,从 50 万篇爬取文档的大型集合中针对 50 个多样化查询筛选出 1,096 篇唯一文档。该测试集旨在评估 IR 模型、排序算法以及不同的自然语言处理技术。接下来,我们对所选文档进行二元相关性标注。我们还针对我们的测试集构建了另外两种用于词形还原和查询扩展的语言资源。使用四种检索模型以及停用词表、词形还原和查询扩展对测试集进行了评估。此外,针对每个查询在不同 NLP 技术下进行了误差分析。据我们所知,本工作是制备乌尔都语标准化信息检索评估测试集的首次尝试。
引用
@article{arxiv.2011.00565,
title = {CURE: Collection for Urdu Information Retrieval Evaluation and Ranking},
author = {Muntaha Iqbal and Kamran Amjad and Bilal Tahir and Muhammad Amir Mehmood},
journal= {arXiv preprint arXiv:2011.00565},
year = {2020}
}