用于预训练序列到序列模型文本排序的 Expando-Mono-Duo 设计模式
信息检索
2021-01-15 v1 计算与语言
摘要
我们提出了一种解决文本排序问题的设计模式,称为“Expando-Mono-Duo”,该模式已在不同领域的若干特设检索任务中得到经验验证。其核心是,我们的设计在标准多阶段排序架构中依赖预训练的序列到序列模型。“Expando”指在倒排索引之前使用文档扩展技术丰富文本的关键词表示。“Mono”和“Duo”指重排序流水线中基于逐点模型和成对模型的组件,用于对使用关键词搜索检索出的初始候选者进行重排序。我们给出了来自 MS MARCO 段落和文档排序任务、TREC 2020 深度学习赛道以及 TREC-COVID 挑战的实验结果,验证了我们的设计。在所有这些任务中,我们达到了最先进水平或接近最先进水平的效能,在某些情况下使用不利用目标任务任何训练数据的零样本方法。为支持可复现性,我们设计模式的实现已在 Pyserini IR 工具包和 PyGaggle 神经重排序库中开源。
引用
@article{arxiv.2101.05667,
title = {The Expando-Mono-Duo Design Pattern for Text Ranking with Pretrained Sequence-to-Sequence Models},
author = {Ronak Pradeep and Rodrigo Nogueira and Jimmy Lin},
journal= {arXiv preprint arXiv:2101.05667},
year = {2021}
}