为 ClueWeb22-B 语料库构建检索系统
信息检索
2024-02-08 v1
摘要
包含近 100 亿份文档的 ClueWeb22 数据集于 2022 年发布,以支持学术和工业研究。该项目的目标是为该数据集“超级头”部分(类别 B)的英文部分构建检索基线。研究社区随后可以使用这些基线来比较他们的系统,并生成数据以训练/评估新的检索和排序算法。本报告涵盖了为该数据集实现的稀疏和密集第一阶段检索以及神经重排序器。这些系统作为服务在卡内基梅隆大学集群上提供。
引用
@article{arxiv.2402.04357,
title = {Building Retrieval Systems for the ClueWeb22-B Corpus},
author = {Harshit Mehrotra and Jamie Callan and Zhen Fan},
journal= {arXiv preprint arXiv:2402.04357},
year = {2024}
}