中文

BEIR:面向信息检索模型零样本评估的异构基准

信息检索 2021-10-22 v4 人工智能 计算与语言

摘要

现有的神经信息检索(IR)模型通常在同质且狭窄的设置下被研究,这极大限制了对它们分布外(OOD)泛化能力的洞察。为此,并为了便于研究者广泛评估其模型的有效性,我们引入了 Benchmarking-IR (BEIR),一个用于信息检索的鲁棒且异构的评估基准。我们精心选取了来自不同文本检索任务和领域的 18 个公开可用数据集,并在 BEIR 基准上评估了 10 个最先进的检索系统,包括词法、稀疏、稠密、延迟交互和重排序架构。我们的结果表明 BM25 是一个鲁棒的基线,基于重排序和延迟交互的模型平均取得了最好的零样本性能,但计算成本较高。相比之下,稠密和稀疏检索模型计算更高效,但常逊于其他方法,凸显其泛化能力仍有相当大的改进空间。我们希望该框架能让我们更好地评估和理解现有检索系统,并有助于加速未来更鲁棒、更可泛化系统的进展。BEIR 已在 https://github.com/UKPLab/beir 公开可用。

关键词

引用

@article{arxiv.2104.08663,
  title  = {BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models},
  author = {Nandan Thakur and Nils Reimers and Andreas Rücklé and Abhishek Srivastava and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2104.08663},
  year   = {2021}
}

备注

Accepted at NeurIPS 2021 Dataset and Benchmark Track