基于内在与外在人类语言资源的耦合查询扩展
计算与语言
2020-04-24 v1 信息检索
摘要
信息检索性能不佳通常归因于查询-文档词汇不匹配问题,该问题被定义为人类用户难以构建与特定搜索目标相关文档词汇相一致的精确自然语言查询。为了缓解这一问题,应用查询扩展过程以生成并向初始查询中整合附加词项。这需要准确识别主要查询概念,以确保预期的搜索目标得到适当强调,并提取相关的扩展概念将其包含在丰富后的查询中。自然语言查询具有内在的语言属性,如词性标注和语法关系,可用于确定预期的搜索目标。此外,还需要如本体等外在的基于语言的资源,以提出与查询内容在语义上连贯的扩展概念。我们在此提出一个查询扩展框架,该框架利用用户查询的语言特征和本体资源进行查询成分编码、扩展概念提取和概念加权。在真实世界数据集上的全面经验评估验证了我们的方法优于一元语言模型、相关模型以及基于序列依赖的技术。
引用
@article{arxiv.2004.11083,
title = {Coupled intrinsic and extrinsic human language resource-based query expansion},
author = {Bhawani Selvaretnam and Mohammed Belkhatir},
journal= {arXiv preprint arXiv:2004.11083},
year = {2020}
}