用于排序评估的数据驱动相关性判断
信息检索
2016-12-20 v1
摘要
排序评估指标是信息检索中设计与改进工作的基本要素。我们观察到,大多数流行指标忽略了用于生成排序的分数中所蕴含的信息(当这些分数可用时)。这可能造成数值缩放问题,导致评估的低估或高估,具体取决于排序项目分数之间的差异程度。本文旨在提出一种原则性的方法,用于量化项目的多级相关性判断,并能够更准确地惩罚排序中的顺序错误。我们提出了一种基于项目分数集之间差异程度的数据驱动相关性函数生成方法,并将其应用于评估指标归一化折损累积增益(nDCG)。我们使用合成数据来展示所提方法的优势,并结合来自 Google News 的新闻条目及其在 Twitter 上的相应流行度数据,展示其与标准 nDCG 相比的性能。结果表明,与标准 nDCG 相比,我们的方法能够提供更细粒度的排序评估,并且鉴于项目分数的差异,标准 nDCG 经常低估或高估其评估分数。
引用
@article{arxiv.1612.06136,
title = {Data-Driven Relevance Judgments for Ranking Evaluation},
author = {Nuno Moniz and Luís Torgo and João Vinagre},
journal= {arXiv preprint arXiv:1612.06136},
year = {2016}
}
备注
12 pages, 4 figures