中文

域外语义来救场!零样本混合检索模型

信息检索 2023-02-21 v1

摘要

基于预训练语言模型(如BERT)的深度检索模型在许多段落检索任务中取得了优于词法检索模型(如BM25)的性能。然而,将深度检索模型泛化到其他任务和领域的工作有限。在这项工作中,我们精心选择了五个数据集,包括两个域内数据集和三个具有不同程度领域偏移的域外数据集,并研究了深度模型在零样本设置下的泛化能力。我们的发现表明,当目标领域与模型训练所依据的源领域非常不同时,深度检索模型的性能显著恶化。相反,词法模型跨领域更具鲁棒性。因此我们提出了一个简单而有效的框架来整合词法和深度检索模型。我们的实验表明,这两种模型是互补的,即使在深度模型在域外设置中较弱时也是如此。混合模型在三个域外数据集上相比深度检索模型平均获得20.4%的相对增益,相比词法模型平均获得9.54%的增益。

关键词

引用

@article{arxiv.2201.10582,
  title  = {Out-of-Domain Semantics to the Rescue! Zero-Shot Hybrid Retrieval Models},
  author = {Tao Chen and Mingyang Zhang and Jing Lu and Michael Bendersky and Marc Najork},
  journal= {arXiv preprint arXiv:2201.10582},
  year   = {2023}
}

备注

Accepted at ECIR 2022 (full paper)