引入查询词独立假设以利用深度神经网络实现高效检索与排序
信息检索
2019-07-09 v1 机器学习
摘要
经典的信息检索(IR)方法,如查询似然与 BM25,针对每个查询词独立地为文档打分,随后累加分数。假设查询词独立使得可以使用这些模型预计算词-文档分数——并可结合倒排索引等专用数据结构以实现高效检索。相比之下,深度神经 IR 模型将整个查询与文档进行比较,因此通常仅用于后期重排序。我们将查询词独立假设引入三种最先进的神经 IR 模型:BERT、Duet 和 CKNRM——并在段落排序任务上评估它们的性能。令人惊讶的是,我们观察到 Duet 和 CKNRM 的结果质量无显著损失——而 BERT 仅有微小退化。然而,通过独立地处理每个查询词,这些原本计算密集的模型变得可进行离线预计算——大幅降低了采用最先进神经排序模型的查询评估代价。该策略使得在大规模集合上使用深度模型进行检索成为可能——而不再将它们的使用限制在后期重排序。
引用
@article{arxiv.1907.03693,
title = {Incorporating Query Term Independence Assumption for Efficient Retrieval and Ranking using Deep Neural Networks},
author = {Bhaskar Mitra and Corby Rosset and David Hawking and Nick Craswell and Fernando Diaz and Emine Yilmaz},
journal= {arXiv preprint arXiv:1907.03693},
year = {2019}
}