中文

NDCG 类型排序度量的理论分析

机器学习 2013-04-25 v1 信息检索 机器学习

摘要

排序中的一个核心问题是设计用于评估排序函数的排序度量。本文从理论角度研究了广泛使用的归一化折损累计增益 (NDCG) 类型排序度量。尽管关于 NDCG 已有大量的实证研究,但对其理论性质知之甚少。我们首先表明,无论排序函数如何,采用对数折损的标准 NDCG 在待排序项目数量趋于无穷大时收敛于 1。乍一看,这一结果非常令人惊讶。它似乎意味着 NDCG 无法区分好坏排序函数,这与 NDCG 在许多应用中的实证成功相矛盾。为了更深入地理解一般的排序度量,我们提出了一个称为“一致可区分性”的概念。这一概念捕捉了这样的直觉:排序度量应具有这样的性质:对于每一对显著不同的排序函数,排序度量能够在几乎所有数据集上一致地判断哪一个更好。我们表明,尽管具有对数折损的 NDCG 对所有排序函数都收敛于相同的极限,但它具有一致可区分性。接下来,我们根据一致可区分性的概念刻画了 NDCG 所有可行折损函数的集合。具体而言,我们表明 NDCG 是否具有一致可区分性取决于折损衰减的速度,而 1/r 是一个临界点。然后我们转向 NDCG 的截断版本,即 NDCG@k。我们分析了各种 k 选择和折损函数下 NDCG@k 的可区分性。在真实 Web 搜索数据集上的实验结果与理论吻合良好。

关键词

引用

@article{arxiv.1304.6480,
  title  = {A Theoretical Analysis of NDCG Type Ranking Measures},
  author = {Yining Wang and Liwei Wang and Yuanzhi Li and Di He and Tie-Yan Liu and Wei Chen},
  journal= {arXiv preprint arXiv:1304.6480},
  year   = {2013}
}

备注

COLT 2013