组短语还是不组短语——用户与系统词项依赖对检索的影响
信息检索
2018-03-07 v2
摘要
在向信息检索(IR)系统提交查询时,用户通常可以指定哪些查询词项(如果有)彼此高度依赖并应作为固定短语处理,例如将其置于引号之间。除了用户指定词项依赖的此类情况外,IR系统也存在自动检测查询中依赖词项的方法。大多数IR系统同时使用用户与算法两种方式。然而,尚不清楚用户定义的词项依赖在何种程度上与算法估计的词项依赖一致,也不清楚二者中哪一种能带来更高的性能增益。简言之,在检测查询中的词项依赖时,信任用户还是系统更好?为回答此问题,我们以101名众包搜索引擎用户和334条查询(52条训练与282条测试TREC查询)进行实验,并对每条查询记录10份评估。我们发现:(i) 用户对词项依赖的评估与算法评估显著不同(其重叠约为30%);(ii) 用户间对查询中词项依赖的共识很少,且随着查询变长这种分歧增大;(iii) 相比词袋基线,处理词项依赖(用户与系统定义皆然)可获取的潜在检索增益仅局限于一小部分(约8%)查询,且对低深度精确率指标的增益远高于深度精确率指标。点(ii)与(iii)构成了对词项依赖的新见解。
引用
@article{arxiv.1802.02603,
title = {To Phrase or Not to Phrase - Impact of User versus System Term Dependence Upon Retrieval},
author = {Christina Lioma and Birger Larsen and Peter Ingwersen},
journal= {arXiv preprint arXiv:1802.02603},
year = {2018}
}