BEIR-PL:面向波兰语的零样本信息检索基准
信息检索
2024-05-17 v2 人工智能
计算与语言
摘要
BEIR 数据集是一个大规模、异构的零样本信息检索(IR)基准,在研究界获得了相当多的关注。然而,BEIR 及类似数据集主要限于英语。我们的目标是建立波兰语 IR 的大规模资源,从而推进该 NLP 领域的研究。受 mMARCO 与 Mr. TyDi 数据集启发,我们将所有可获取的开放 IR 数据集翻译为波兰语,并引入了 BEIR-PL 基准——一个包含 13 个数据集的新基准,以促进现代波兰语 IR 语言模型的进一步开发、训练与评估。我们在新引入的 BEIR-PL 基准上执行了众多 IR 模型的评估与比较。此外,我们发布了波兰语的预训练开放 IR 模型,这是该领域的开创性进展。评估还显示,BM25 在波兰语上的得分显著低于英语,这可归因于波兰语高度屈折与复杂的形态结构。最后,我们训练了多种重排序模型以增强 BM25 检索,并比较其性能以识别各自特征。为准确比较模型,需审视各子集结果而非对整个基准取平均。因此,我们详尽分析了 IR 模型相对于 BEIR 基准所涵盖各数据子集的表现。基准数据见 URL {\bf https://huggingface.co/clarin-knext}。
引用
@article{arxiv.2305.19840,
title = {BEIR-PL: Zero Shot Information Retrieval Benchmark for the Polish Language},
author = {Konrad Wojtasik and Vadim Shishkin and Kacper Wołowiec and Arkadiusz Janz and Maciej Piasecki},
journal= {arXiv preprint arXiv:2305.19840},
year = {2024}
}