基于 BERT 的多阶段文档排序
信息检索
2019-11-01 v1 机器学习
摘要
通过语言建模任务预训练的深度神经网络的出现推动了自然语言处理中许多成功应用。本工作探索了这样一种流行模型 BERT 在文档排序中的应用。我们提出两种变体,称为 monoBERT 与 duoBERT,分别将排序问题表述为逐点分类与成对分类。这两个模型被安排在一个多阶段排序架构中以构成端到端搜索系统。该设计的一个主要优势是能够通过控制进入各流水线阶段的候选数量来权衡质量与延迟,借此我们能够找到在这两个竞争指标间提供良好平衡的运作点。在两个大规模数据集 MS MARCO 与 TREC CAR 上的实验表明,我们的模型取得的结果达到或可与当前最优(state of the art)相媲美。消融实验显示了各组件的贡献并刻画了延迟/质量权衡空间。
引用
@article{arxiv.1910.14424,
title = {Multi-Stage Document Ranking with BERT},
author = {Rodrigo Nogueira and Wei Yang and Kyunghyun Cho and Jimmy Lin},
journal= {arXiv preprint arXiv:1910.14424},
year = {2019}
}