一个有效性度量究竟拥有多少自由度?
信息检索
2024-01-24 v2
摘要
人们容易假定,由于有效性度量可自由地为搜索引擎结果页(SERP)分配分数,因此在SERP对的相对排序上必然也存在类似的自由度。事实上,第二种自由度在相当程度上是虚幻的。这是因为,若一对SERP中某一个已被某度量赋予特定分数,基本排序约束在许多情况下会进而规定第二个SERP的分数必须不小于或不大于赋予第一个SERP的分数。我们将这些固定关系称为内在成对SERP排序。我们在本工作中的首要目标是描述并论证这些成对SERP关系约束,并通过穷举与经验实验列出其相对出现频率。随后我们思考如何在IR实验中运用此类内在成对关系,从而提出一种新的测量范式。具体而言,我们认为应避免列出多种不同度量用于冠军系统与挑战者系统比较的结果表格;而应基于原则性理由论证单一度量,并由该度量识别出的关系通过评估内在关系来强化——即判断其他度量(事实上是所有其他度量)是否可能产生相同的系统对系统结果。
引用
@article{arxiv.2309.09477,
title = {How Much Freedom Does An Effectiveness Metric Really Have?},
author = {Alistair Moffat and Joel Mackenzie},
journal= {arXiv preprint arXiv:2309.09477},
year = {2024}
}
备注
To Appear: Journal of the Association for Information Science and Technology, 2024