中文

面向低成本信息检索评价的智能主题选择:深判断与浅判断的新视角

信息检索 2017-09-20 v4

摘要

尽管测试集为基于 Cranfield 的信息检索(IR)系统评价提供了基石,但依赖传统池化技术(pooling techniques)以当今海量文档集合的规模构建测试集在实践中已变得不可行。在本文中,我们提出一种新的智能主题选择方法,减少了可靠 IR 评价所需的搜索主题数量。为了严格评估我们的方法,我们整合了先前关于智能主题选择和深判断与浅判断互不相关的研究方向。虽然先前关于智能主题选择的工作从未针对浅判断基线进行评估,但先前关于深判断与浅判断的工作主要在假设随机主题选择的情况下论证了浅判断的合理性。我们认为,对于评估任何主题选择方法,最终必须问的是:选择主题是否真正有用,还是应该简单地对许多主题进行浅判断?在寻求对这一首要问题的严格答案时,我们对一组以前从未一起研究过的相关因素进行了全面调查:1) 主题选择方法;2) 主题熟悉度对人类判断速度的影响;3) 不同主题生成过程如何影响 (i) 预算利用和 (ii) 判断结果的质量。在 NIST TREC Robust 2003 和 Robust 2004 测试集上的实验表明,我们不仅能用更少的主题可靠地评价 IR 系统,而且:1) 当主题被智能选择时,在评价可靠性方面深判断通常比浅判断更具成本效益;2) 主题熟悉度和主题生成成本极大地影响了评价成本与可靠性的权衡。我们的发现挑战了传统观念,表明当主题被智能选择时,深判断通常优于浅判断。

关键词

引用

@article{arxiv.1701.07810,
  title  = {Intelligent Topic Selection for Low-Cost Information Retrieval Evaluation: A New Perspective on Deep vs. Shallow Judging},
  author = {Mucahid Kutlu and Tamer Elsayed and Matthew Lease},
  journal= {arXiv preprint arXiv:1701.07810},
  year   = {2017}
}