NeuCLIRTech:面向挑战性领域的中文 monolingual 与 cross-language 信息检索评估
信息检索
2026-02-06 v1
摘要
衡量信息检索进步需要能够忠实区分系统的相关性判断。本文提出NeuCLIRTech,一个用于跨语言检索技术信息的评估集合。该集合由用中文原生编写的技术文档及其相同文档的英文机器翻译版本组成。包含110个查询及其相关性判断。该集合支持两种检索场景:中文 monolingual 检索,以及以英文查询语言为主的跨语言检索。NeuCLIRTech 将 TREC NeuCLIR track 2023 年和 2024 年的主题合并。110个查询和35,962个文档判断在尝试区分检索方法时提供了强大的统计判别力。包括一个由强大神经检索系统构成的融合基线,以便开发者无需依赖BM25作为第一阶段检索器。该数据集和制品已发布于 Huggingface Datasets。
引用
@article{arxiv.2602.05334,
title = {NeuCLIRTech: Chinese Monolingual and Cross-Language Information Retrieval Evaluation in a Challenging Domain},
author = {Dawn Lawrie and James Mayfield and Eugene Yang and Andrew Yates and Sean MacAvaney and Ronak Pradeep and Scott Miller and Paul McNamee and Luca Soldaini},
journal= {arXiv preprint arXiv:2602.05334},
year = {2026}
}
备注
14 pages, 6 figures