基于最大化效能差异的排序相似度度量族
信息检索
2014-08-18 v1
摘要
排序相似度度量提供了一种无需相关性判断即可量化搜索引擎结果差异的方法。例如,搜索服务提供者可以利用此类度量估计拟议算法变更对大量查询(可能达数百万)的影响,并识别出受影响最大的查询。本文提出并验证了一族排序相似度度量,每个度量均源自一个关联的效能度量。该族中的每个成员均基于在该关联度量下最大化效能差异。计算此最大化效能差异(MED)需要解决一个优化问题,其难度取决于关联度量。我们针对包括 nDCG、MAP 和 ERR 在内的几种标准效能度量提出了解决方案。通过实验验证,我们表明 MED 揭示了检索运行之间的有意义差异。在数学上,无论关联度量如何,MED 均是一个度量(metric)。先前的工作已在搜索背景下确立了若干其他排序相似度期望属性,我们证明 MED 满足这些要求。与先前的提案不同,MED 允许我们将关于用户行为的假设直接从任何已建立的效能度量转化为相应的排序相似度度量。此外,MED 能够清晰地适应部分相关性判断,若具备完整的相关信息,则简化为效能值之间的简单差异。
引用
@article{arxiv.1408.3587,
title = {A Family of Rank Similarity Measures based on Maximized Effectiveness Difference},
author = {Luchen Tan and Clarke L. A. Clarke},
journal= {arXiv preprint arXiv:1408.3587},
year = {2014}
}