中文

近似召回率置信区间

信息检索 2012-10-25 v4

摘要

召回率(检索到的相关文档的比例)是信息检索中有效性的重要度量,尤其在法律、专利和医学领域至关重要。当文档集过大而无法进行穷尽的相关性评估时,可以通过评估随机文档样本来估计召回率;但也需要指出该估计的可靠性。在本文中,我们考察了几种估计双尾召回率置信区间的方法。我们发现,当前使用的正态近似在许多情况下提供的覆盖率较差,即使经过调整以纠正其不适当的对称性也是如此。基于二项式比率的解析方法和贝叶斯方法通常更准确,但在小总体中不准确。我们推荐的方法导出了具有固定超参数的检索和未检索产出的 beta-二项后验分布,并对召回率的后验分布进行 Monte Carlo 估计。我们证明,该方法在多种场景下给出的平均覆盖率处于或接近名义水平,同时具有平衡性和稳定性。我们就抽样设计提供了建议,包括将评估分配给检索和未检索部分,并将提出的 beta-二项方法与最近 TREC Legal Track 迭代中官方报告的正态区间进行了比较。

关键词

引用

@article{arxiv.1202.2880,
  title  = {Approximate Recall Confidence Intervals},
  author = {William Webber},
  journal= {arXiv preprint arXiv:1202.2880},
  year   = {2012}
}

备注

To appear in ACM Transactions on Information Systems