Surprise:基于极值理论的结果列表截断
信息检索
2020-10-21 v1 机器学习
应用统计
摘要
信息检索领域的工作主要围绕排序与相关度展开:给定查询,返回若干按与用户相关度排序的结果。然而,结果列表截断问题,即在哪里截断排序结果列表,尽管在多种应用中至关重要,却较少受到关注。此类截断是在整体相关度(或结果的有用性)与用户处理更多结果的成本之间的权衡。结果列表截断可能具有挑战性,因为相关度分数常常未经良好校准。在大规模 IR 系统中这一点尤为明显,其中文档与查询被嵌入同一度量空间,推理时返回查询的最近文档邻域。此处相关度与查询和候选文档间距离成反比,但何种距离构成相关度因查询而异,并随索引中新增文档而动态变化。本工作中,我们提出 Surprise 打分,一种利用极值理论中出现的广义 Pareto 分布的统计方法,仅使用排序分数即可在查询时生成可解释且校准的相关度分数。我们在图像、文本与 IR 数据集上的结果列表截断任务中展示了其有效性,并与经典及近期基线进行比较。我们建立了与假设检验及 -值的联系。
引用
@article{arxiv.2010.09797,
title = {Surprise: Result List Truncation via Extreme Value Theory},
author = {Dara Bahri and Che Zheng and Yi Tay and Donald Metzler and Andrew Tomkins},
journal= {arXiv preprint arXiv:2010.09797},
year = {2020}
}