重新思考多阶段检索流水线中 BERT 重排序器的训练
信息检索
2021-01-22 v1
摘要
预训练深度语言模型(LM)已推进了文本检索的最先进水平。由深度 LM 微调得到的重排序器基于丰富的上下文匹配信号估计候选相关性。同时,深度 LM 也可用于改进搜索索引,构建具有更好召回率的检索器。人们会预期二者在流水线中的直接组合带来叠加的性能增益。本文中,我们发现事实并非如此,且流行的重排序器无法充分利用改进后的检索结果。因此,我们提出一种用于训练重排序器的局部对比估计(LCE),并证明其显著改善了深度两阶段模型。
引用
@article{arxiv.2101.08751,
title = {Rethink Training of BERT Rerankers in Multi-Stage Retrieval Pipeline},
author = {Luyu Gao and Zhuyun Dai and Jamie Callan},
journal= {arXiv preprint arXiv:2101.08751},
year = {2021}
}
备注
ECIR 2021