文档排序中的可重复性边界情形:分数并列的影响
信息检索
2019-09-04 v2
摘要
文档排序实验应当是可重复的。然而,多线程索引与检索过程中的分数并列之间的交互可能产生非确定性排序,使得可重复性并不像人们想象的那样简单。在开源搜索引擎 Lucene 的背景下,分数并列由索引时分配的内部文档 id 打破。由于多线程索引使得对大型现代文档集合的实验变得可行,内部文档 id 在同一集合的不同索引实例之间并非一致分配,因此分数并列的打破是不可预测的。这篇短文考察了此类分数并列对效果的影响,量化了可归因于该现象的可变性。确保非确定性的消除以及可重复文档排序的明显解决方案是使用外部集合文档 id 来打破分数并列。然而,这种方法由于查询评估期间必须查询外部标识符而带来可度量的效率代价。
引用
@article{arxiv.1807.05798,
title = {Repeatability Corner Cases in Document Ranking: The Impact of Score Ties},
author = {Jimmy Lin and Peilin Yang},
journal= {arXiv preprint arXiv:1807.05798},
year = {2019}
}
备注
Published in the Proceedings of the 42nd Annual International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2019)