低成本信息检索评估:更少主题、无需相关性判定与众包评分
信息检索
2020-11-03 v1
摘要
为评估信息检索(IR)效果,一种可能的途径是使用测试集,其由文档集合、一组信息需求描述(称为主题)以及每个主题的一组相关文档组成。测试集以竞赛场景为模型:例如在著名的 TREC 计划中,参与者在一组主题上运行自己的检索系统,并提供检索文档的排序列表;部分检索到的文档(通常是排名靠前的)构成所谓的池(pool),其相关性由人工评估者评定;随后该文档列表用于计算效果指标并对参与者系统排序。私有网络搜索公司也开展内部评估活动;尽管细节大多未知且目标有所不同,但整体方法与测试集方法存在若干共性问题。本工作的目标是:(i)在节省资源的同时发展并改进关于 IR 效果评估的一些前沿工作;(ii)提出一种新颖、更具原则性与工程化的、基于测试集的效果评估整体方法。[...]
引用
@article{arxiv.2011.00479,
title = {Cheap IR Evaluation: Fewer Topics, No Relevance Judgements, and Crowdsourced Assessments},
author = {Kevin Roitero},
journal= {arXiv preprint arXiv:2011.00479},
year = {2020}
}