BEIR:面向信息检索模型零样本评估的异构基准
信息检索
2021-10-22 v4 人工智能
计算与语言
摘要
现有的神经信息检索(IR)模型通常在同质且狭窄的设置下被研究,这极大限制了对它们分布外(OOD)泛化能力的洞察。为此,并为了便于研究者广泛评估其模型的有效性,我们引入了 Benchmarking-IR (BEIR),一个用于信息检索的鲁棒且异构的评估基准。我们精心选取了来自不同文本检索任务和领域的 18 个公开可用数据集,并在 BEIR 基准上评估了 10 个最先进的检索系统,包括词法、稀疏、稠密、延迟交互和重排序架构。我们的结果表明 BM25 是一个鲁棒的基线,基于重排序和延迟交互的模型平均取得了最好的零样本性能,但计算成本较高。相比之下,稠密和稀疏检索模型计算更高效,但常逊于其他方法,凸显其泛化能力仍有相当大的改进空间。我们希望该框架能让我们更好地评估和理解现有检索系统,并有助于加速未来更鲁棒、更可泛化系统的进展。BEIR 已在 https://github.com/UKPLab/beir 公开可用。
引用
@article{arxiv.2104.08663,
title = {BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models},
author = {Nandan Thakur and Nils Reimers and Andreas Rücklé and Abhishek Srivastava and Iryna Gurevych},
journal= {arXiv preprint arXiv:2104.08663},
year = {2021}
}
备注
Accepted at NeurIPS 2021 Dataset and Benchmark Track