中文

Quati:来自母语者的巴西葡萄牙语信息检索数据集

信息检索 2024-04-11 v1

摘要

尽管葡萄牙语是世界上使用最广泛的语言之一,但该语言缺乏高质量的信息检索数据集。我们提出了Quati,一个专门为巴西葡萄牙语设计的数据集。它包含由母语者制定的查询集合以及从精选的高质量巴西葡萄牙语网站中获取的文档集。与随机抓取的网站相比,这些网站更可能被真实用户访问,从而确保更具代表性和相关性的语料库。为了标注查询-文档对,我们使用最先进的LLM,其标注者间一致性水平在我们的评估中与人类表现相当。我们提供了标注方法的详细描述,以便其他人可以为其他语言创建类似的数据集,从而提供一种经济高效的方式来创建高质量IR数据集,每个查询具有任意数量的标注文档。最后,我们评估了各种开源和商业检索器作为基线系统。Quati在https://huggingface.co/datasets/unicamp-dl/quati公开提供,所有脚本在https://github.com/unicamp-dl/quati。

关键词

引用

@article{arxiv.2404.06976,
  title  = {Quati: A Brazilian Portuguese Information Retrieval Dataset from Native Speakers},
  author = {Mirelle Bueno and Eduardo Seiti de Oliveira and Rodrigo Nogueira and Roberto A. Lotufo and Jayr Alencar Pereira},
  journal= {arXiv preprint arXiv:2404.06976},
  year   = {2024}
}

备注

22 pages