信息检索中的批量评估指标:度量、标度与意义
信息检索
2022-07-08 v1
摘要
近期一系列论文考察了测量标度在信息检索(IR)实验中的作用,并提出论点认为应当(仅)使用均匀步长区间标度,因此诸如倒数排名、期望倒数排名、归一化折损累计增益和平均精度等知名指标,应当要么作为测量工具被弃用,要么被改造使其指标值落在数轴上的均匀间隔点上。这些论文对过去几十年的 IR 评估描绘了一幅相当黯淡的图景,与该社区对实际实验和可度量改进的总体侧重相悖。我们在本工作中的目的是挑战这一立场。特别地,我们认为只要每个目标点的选取存在外部理由,从分类数据和有序数据到数轴上点集的映射就是有效的。我们首先考察测量标度以及分类、有序、区间、比例和绝对数据收集的一般作用。就前两类而言,我们还提供了通过到实轴线的数值映射所捕获和表示的知识的示例。随后聚焦于信息检索,我们认为文档排序是分类数据,而有效性指标的作用是提供单一数值来表示任一给定排序对某个用户或用户群体的有用性,且有用性能够表示为比例标度上的连续变量。也就是说,我们认为当前的 IR 指标是有充分依据的,而且这些指标在其当前形式下比所提议的“区间化”版本更具意义。
引用
@article{arxiv.2207.03103,
title = {Batch Evaluation Metrics in Information Retrieval: Measures, Scales, and Meaning},
author = {Alistair Moffat},
journal= {arXiv preprint arXiv:2207.03103},
year = {2022}
}