中文

基于查询性能预测的查询特定变深度池化以减少相关性标注负担

信息检索 2023-04-25 v1

摘要

由于测试集合规模庞大,信息检索(IR)评估中的标准做法是构建由多种不同检索系统返回的前 k 篇文档组成的候选相关文档“池”——这一过程称为深度 k 池化。标准做法是将构成基准集合的每个查询的深度(k)设为常数。然而,本文我们认为,若使池的深度对每个查询成为可变量,标注负担可大幅降低,其理由是与信息需求相关的文档数量在不同查询间差异很大。我们的假设是,对前一类查询采用较低深度、对后一类采用较高深度,可在不显著改变检索效果评估的情况下潜在地减少标注负担。我们利用标准查询性能预测(QPP)技术来估计每个查询的潜在相关文档数量,并据此确定池的深度。我们在标准测试集合上的实验表明,这种采用查询特定可变深度的所提方法能够以大幅减少的标注负担充分反映 IR 系统的相对有效性。

关键词

引用

@article{arxiv.2304.11752,
  title  = {Query-specific Variable Depth Pooling via Query Performance Prediction towards Reducing Relevance Assessment Effort},
  author = {Debasis Ganguly and Emine Yilmaz},
  journal= {arXiv preprint arXiv:2304.11752},
  year   = {2023}
}

备注

To appear in SIGIR 2023