排序偏差重叠中的平分处理
信息检索
2024-06-12 v1 统计方法学
摘要
排序偏差重叠(RBO)是用于不确定排序的相似度度量:它具有顶部加权特性,能够仅从排序前缀已知或仅有部分公共条目的情况下进行计算。它被广泛用于例如分析搜索引擎差异,通过比较检索相同查询的文档排序。在这些情况下,经常会发现具有相同得分的平行文档。不幸的是,RBO 中平分的处理仍不充分且不完整,即仅从排序前缀计算它并不清晰。在此基础上,现有的平分处理方式与统计学领域传统做法差异很大,尤其是在Kendall's 和 Spearman's 等秩相关系数中。本文提出了 RBO 的一种广义公式,用于处理平分,从而完成原始定义,显示如何进行前缀评估。我们还利用它充分发展出两种变体,这两种变体符合统计学文献中所见:一种是当存在用于比较的参考排序时,另一种是当不存在时。总体而言,这三种变体为研究人员在使用 RBO 比较排序时提供了灵活性,明确确定平分的含义,以及如何处理它们。最后,我们使用合成数据和 TREC 数据演示了这些新型平分感知 RBO 测度的用法。我们显示得分可能与原始的平分不敏感 RBO 测度(其中必须随机或通过文档 ID 等任意标准打破平分)有显著差异。总体而言,这些结果凸显了在此类 RBO 等排序相似度测度中正确处理平分的必要性。
引用
@article{arxiv.2406.07121,
title = {The Treatment of Ties in Rank-Biased Overlap},
author = {Matteo Corsi and Julián Urbano},
journal= {arXiv preprint arXiv:2406.07121},
year = {2024}
}
备注
10 pages, 5 figures, 4 tables, SIGIR 2024