MessIRve:一个大规模西班牙语信息检索数据集
计算与语言
2025-11-20 v2 人工智能
摘要
信息检索(IR)是根据用户查询查找相关文档的任务。尽管西班牙语是第二大母语,但西班牙语 IR 数据集很少,这限制了为西班牙语使用者开发信息获取工具。我们介绍了 MessIRve,一个大规模西班牙语 IR 数据集,包含来自谷歌自动补全 API 的近 70 万个查询以及来自维基百科的相关文档。与其他从英语翻译而来或不考虑方言变化的数据集不同,MessIRve 的查询反映了多样化的西班牙语地区。该数据集的庞大规模使其能够覆盖广泛的主题,这与较小的数据集不同。我们提供了该数据集的全面描述、与现有数据集的比较以及对主流 IR 模型的基线评估。我们的贡献旨在推进西班牙语 IR 研究,并改善西班牙语使用者的信息获取。
引用
@article{arxiv.2409.05994,
title = {MessIRve: A Large-Scale Spanish Information Retrieval Dataset},
author = {Francisco Valentini and Viviana Cotik and Damián Furman and Ivan Bercovich and Edgar Altszyler and Juan Manuel Pérez},
journal= {arXiv preprint arXiv:2409.05994},
year = {2025}
}
备注
Camera-ready for EMNLP 2025 (main conference)