理解与预测信息检索中测试集的特征
信息检索
2022-06-07 v3
摘要
信息检索领域的研究团体评测,如 NIST 的文本检索会议(TREC),通过汇集多个团队提交的文档排序来构建可复用的测试集。自然地,所得测试集的质量因而极大依赖于参与团队的数量及其提交运行的质量。本工作中,我们研究:i)参与者数量与其他因素相结合如何影响测试集的质量;以及 ii)是否可在从人类评估者收集相关性判断之前推断测试集的质量。在六个 TREC 测试集上进行的实验说明了团队数量如何与各种其他因素相互作用以影响所得测试集的质量。我们还表明,当同一文档集在评测活动中连续多年使用(如 TREC 中常见)时,测试集的可复用性可被高精度预测。
引用
@article{arxiv.2012.13292,
title = {Understanding and Predicting Characteristics of Test Collections in Information Retrieval},
author = {Md Mustafizur Rahman and Mucahid Kutlu and Matthew Lease},
journal= {arXiv preprint arXiv:2012.13292},
year = {2022}
}
备注
Accepted as a full paper at iConference 2022