中文

一种利用伪相关网络知识的查询扩展新模型

信息检索 2022-08-16 v1

摘要

在信息检索领域,查询扩展(QE)长期以来被用作处理用户查询与目标信息之间词不匹配基本问题的技术。在查询与扩展词关系的背景下,现有的加权技术往往无法恰当捕获词-词关系以及词与整体查询的关系,导致检索效果不佳。我们提出的 QE 方法通过基于(1) tf-itf、(2) 基于 k 近邻(kNN)的余弦相似度、(3) 相关性分数的三种加权模型来解决这个问题。此外,为提取初始扩展词集合,我们使用伪相关网络知识,其由 Google、Bing 和 DuckDuckGo 三个流行搜索引擎针对原始查询返回的前 N 个网页组成。在这三种加权模型中,tf-itf 对从网络内容获得的各个词打分,基于 kNN 的余弦相似度对扩展词打分以获得词-词关系,相关性分数将所选扩展词相对于整个查询进行加权。所提出的模型称为基于网络知识的查询扩展(WKQE),在 FIRE 数据集上相比未扩展查询在 MAP 分数上实现了 25.89% 的提升,在 GMAP 分数上实现了 30.83% 的提升。WKQE 技术与其他相关方法的比较分析清楚地显示了检索性能的显著提升。我们还分析了伪相关文档数量和扩展词数量的变化对所提模型检索效果的影响。

关键词

引用

@article{arxiv.1908.10193,
  title  = {A novel model for query expansion using pseudo-relevant web knowledge},
  author = {Hiteshwar Kumar Azad and Akshay Deepak},
  journal= {arXiv preprint arXiv:1908.10193},
  year   = {2022}
}

备注

32 pages