中文

CoRT:基于 Transformer 的互补排序

信息检索 2021-05-26 v2 计算与语言 机器学习

摘要

许多近期面向神经信息检索的方法通过采用多阶段排序流水线来降低计算成本。在第一阶段,使用 BM25 等高效检索模型检索若干潜在相关候选。尽管 BM25 作为第一阶段排序器已证明具有不错性能,它往往遗漏相关段落。在此背景下,我们提出 CoRT,一种简单的神经第一阶段排序模型,它利用 BERT 等预训练语言模型的上下文表示来补充基于词的排序函数,同时在查询时不会引起显著延迟。使用 MS MARCO 数据集,我们表明 CoRT 通过以缺失候选补充 BM25 显著提升了候选召回率。进而,我们发现后续重排序器以更少候选取得了更优结果。我们进一步证明,使用 CoRT 的段落检索可以以惊人低的延迟实现。

关键词

引用

@article{arxiv.2010.10252,
  title  = {CoRT: Complementary Rankings from Transformers},
  author = {Marco Wrzalik and Dirk Krechel},
  journal= {arXiv preprint arXiv:2010.10252},
  year   = {2021}
}

备注

NAACL-HLT 2021, Long Paper