中文

NeuCLIRBench:面向单语、跨语和多语信息检索的现代评估集合

信息检索 2025-11-19 v1

摘要

为了衡量检索系统的进展,需要具备能够忠实区分系统的相关性判断的测试集合。本文提出了 NeuCLIRBench,一个用于跨语言和多语检索的评估集合。该集合由以中文、波斯语和俄语为母语的文档构成,同时包含这些文档的英文机器翻译版本。该集合支持多种检索场景,包括:以英文、中文、波斯语或俄语为查询语言的单语检索;以英文为查询语言、另一种语言为文档语言的跨语检索;以及以英文为查询语言、三种语言均包含相关文档的多语检索。NeuCLIRBench 将 TREC NeuCLIR 轨道 2022、2023 和 2024 年的主题合并而成。对于单语和跨语任务,250,128 条相关性判断覆盖约 150 个查询;对于多语检索,100 个查询提供了强大的统计判别力,以区分检索方法。随集合一起提供的 BM25 的强大神经检索系统的融合基线,使开发者不再依赖 BM25 作为一级检索器。NeuCLIRBench 已公开提供。

关键词

引用

@article{arxiv.2511.14758,
  title  = {NeuCLIRBench: A Modern Evaluation Collection for Monolingual, Cross-Language, and Multilingual Information Retrieval},
  author = {Dawn Lawrie and James Mayfield and Eugene Yang and Andrew Yates and Sean MacAvaney and Ronak Pradeep and Scott Miller and Paul McNamee and Luca Soldani},
  journal= {arXiv preprint arXiv:2511.14758},
  year   = {2025}
}

备注

14 pages, 1 figure