中文

重新思考多阶段检索流水线中 BERT 重排序器的训练

信息检索 2021-01-22 v1

摘要

预训练深度语言模型(LM)已推进了文本检索的最先进水平。由深度 LM 微调得到的重排序器基于丰富的上下文匹配信号估计候选相关性。同时,深度 LM 也可用于改进搜索索引,构建具有更好召回率的检索器。人们会预期二者在流水线中的直接组合带来叠加的性能增益。本文中,我们发现事实并非如此,且流行的重排序器无法充分利用改进后的检索结果。因此,我们提出一种用于训练重排序器的局部对比估计(LCE),并证明其显著改善了深度两阶段模型。

关键词

引用

@article{arxiv.2101.08751,
  title  = {Rethink Training of BERT Rerankers in Multi-Stage Retrieval Pipeline},
  author = {Luyu Gao and Zhuyun Dai and Jamie Callan},
  journal= {arXiv preprint arXiv:2101.08751},
  year   = {2021}
}

备注

ECIR 2021