中文

用于构建 BEIR 的资源:可复现参考模型与官方排行榜

信息检索 2023-06-14 v1 计算与语言

摘要

BEIR 是一个用于在 18 种不同领域/任务组合上零样本评估信息检索模型的基准数据集。近年来,我们见证了以表征学习构建检索模型的日益流行,通常在监督设置下使用预训练变换器。这自然引出一个问题:当面对与训练数据不同的查询和文档时,这些模型的有效性如何?例子包括在不同领域(如医学或法律文本)中搜索,以及使用不同类型的查询(如关键词 vs. 完整问句)。虽然 BEIR 旨在回答这些问题,但我们的工作解决了阻碍该基准充分发挥潜力的两个缺陷:首先,现代神经方法的复杂性与当前软件基础设施的复杂性为新研究者设置了准入壁垒。为此,我们提供涵盖两类主要方法的可复现参考实现:学习型稠密与稀疏模型。其次,目前不存在一个权威的单一枢纽来报告不同模型在 BEIR 上的有效性,导致难以比较不同方法。为此,我们提出一个官方自助式 BEIR 排行榜,提供对检索模型公平且一致的比较。通过解决这两个缺陷,我们的工作促进了 BEIR 所赋能的一系列有趣研究问题的未来探索。

关键词

引用

@article{arxiv.2306.07471,
  title  = {Resources for Brewing BEIR: Reproducible Reference Models and an Official Leaderboard},
  author = {Ehsan Kamalloo and Nandan Thakur and Carlos Lassance and Xueguang Ma and Jheng-Hong Yang and Jimmy Lin},
  journal= {arXiv preprint arXiv:2306.07471},
  year   = {2023}
}