中文

MessIRve:一个大规模西班牙语信息检索数据集

计算与语言 2025-11-20 v2 人工智能

摘要

信息检索(IR)是根据用户查询查找相关文档的任务。尽管西班牙语是第二大母语,但西班牙语 IR 数据集很少,这限制了为西班牙语使用者开发信息获取工具。我们介绍了 MessIRve,一个大规模西班牙语 IR 数据集,包含来自谷歌自动补全 API 的近 70 万个查询以及来自维基百科的相关文档。与其他从英语翻译而来或不考虑方言变化的数据集不同,MessIRve 的查询反映了多样化的西班牙语地区。该数据集的庞大规模使其能够覆盖广泛的主题,这与较小的数据集不同。我们提供了该数据集的全面描述、与现有数据集的比较以及对主流 IR 模型的基线评估。我们的贡献旨在推进西班牙语 IR 研究,并改善西班牙语使用者的信息获取。

关键词

引用

@article{arxiv.2409.05994,
  title  = {MessIRve: A Large-Scale Spanish Information Retrieval Dataset},
  author = {Francisco Valentini and Viviana Cotik and Damián Furman and Ivan Bercovich and Edgar Altszyler and Juan Manuel Pérez},
  journal= {arXiv preprint arXiv:2409.05994},
  year   = {2025}
}

备注

Camera-ready for EMNLP 2025 (main conference)