中文

将文档与查询表示为词嵌入向量集用于信息检索

信息检索 2016-06-28 v1

摘要

将词向量嵌入应用于信息检索(IR)的一个主要困难在于,如何设计一种有效且高效的策略,为文本的复合单元(如整篇文档,与原子词相比)获取表示,以用于文档索引和评分。我们并非致力于寻找一种合适的方法来获取大型文本文档的单一向量表示,而是旨在开发一种相似性度量,利用文档和查询中各个嵌入词向量之间的相似性。具体而言,我们将文档和查询表示为词向量集,并使用这些集合之间相似性的标准概念,该概念基于这些集合中每对组成词之间相似性的函数计算得出。然后,我们将此相似性度量与标准的基于 IR 的相似性结合用于文档排序。我们的初步实验研究结果表明,在 TREC 即席数据集上,与标准的基于文本的语言模型相似性相比,我们提出的方法将 MAP 提高了最多 5.77%5.77\%

关键词

引用

@article{arxiv.1606.07869,
  title  = {Representing Documents and Queries as Sets of Word Embedded Vectors for Information Retrieval},
  author = {Dwaipayan Roy and Debasis Ganguly and Mandar Mitra and Gareth J. F. Jones},
  journal= {arXiv preprint arXiv:1606.07869},
  year   = {2016}
}

备注

Neu-IR '16 SIGIR Workshop on Neural Information Retrieval July 21, 2016, Pisa, Italy