相关性判断的变化与测试集的保质期
信息检索
2025-05-22 v2
摘要
Cranfield风格评估的基本特性——即即使评估者在单个相关性判断上存在分歧,系统排名依然稳定——已在传统测试集上得到验证。然而,向神经检索模型的范式转变影响了现代测试集的特征,例如文档简短、相关性分为四个等级,且信息需求没有描述或叙述。在这些变化下,评估者的分歧对于系统比较是否仍然可以忽略不计尚不清楚。我们在现代测试集被大量重复使用的额外条件下研究了这一方面。由于形式化信息需求的减少导致更多可能的查询解释,如果最高有效性要求对单一相关性解释过拟合,那么测试集可能需要一个“保质期”。我们进行了一项可复现性研究,并重新标注了2019年TREC Deep Learning track的相关性判断。我们能够在神经检索设置下复现先前的工作,表明评估者的分歧不会影响系统排名。然而,我们观察到一些模型在我们新的相关性判断下性能显著下降,而一些模型作为排序器已经达到了人类的有效性水平,这提供了测试集可能过期的证据。
引用
@article{arxiv.2502.20937,
title = {Variations in Relevance Judgments and the Shelf Life of Test Collections},
author = {Andrew Parry and Maik Fröbe and Harrisen Scells and Ferdinand Schlatt and Guglielmo Faggioli and Saber Zerhoudi and Sean MacAvaney and Eugene Yang},
journal= {arXiv preprint arXiv:2502.20937},
year = {2025}
}
备注
11 pages, 6 tables, 5 figures, Accepted to SIGIR 2025