插值与否:PRF、稠密与稀疏检索器
信息检索
2022-05-03 v1
摘要
当前预训练语言模型在信息检索中的应用可大致分为两类:稀疏检索器(也包括非神经方法,如词袋法,例如 BM25)和稠密检索器。这两类检索器似乎各自捕捉了相关性的不同特征。先前的工作研究了如何通过插值将稀疏检索器的相关性信号与稠密检索器的相结合,这种插值通常能带来更高的检索效果。本文考虑在伪相关反馈(PRF)背景下结合稀疏与稠密检索器相关性信号的问题。该背景带来两个关键挑战:(1) 何时进行插值:在 PRF 过程之前、之后,还是之前和之后都进行?(2) 应考虑哪种稀疏表示:零样本词袋模型(BM25)还是学习得到的稀疏表示?为回答这些问题,我们进行了详尽的实证评估,考虑了有效且可扩展的神经 PRF 方法(Vector-PRF)、三种有效的稠密检索器(ANCE、TCTv2、DistillBERT)以及一种最先进的学习稀疏检索器(uniCOIL)。实验的实证结果表明,无论稀疏表示和稠密检索器如何,在 PRF 前后均进行插值在绝大多数数据集和指标上取得了最高效果。
引用
@article{arxiv.2205.00235,
title = {To Interpolate or not to Interpolate: PRF, Dense and Sparse Retrievers},
author = {Hang Li and Shuai Wang and Shengyao Zhuang and Ahmed Mourad and Xueguang Ma and Jimmy Lin and Guido Zuccon},
journal= {arXiv preprint arXiv:2205.00235},
year = {2022}
}
备注
Short research paper, accepted at SIGIR2022