中文

利用词嵌入进行自动查询扩展

信息检索 2016-06-27 v1

摘要

本文提出一个使用分布式神经语言模型 word2vec 进行自动查询扩展的框架。word2vec 利用分布式无监督框架中的语义和上下文关系,为每个词汇条目学习一个低维嵌入。利用该框架,我们设计了一种查询扩展技术,通过 K 近邻方法获取与查询相关的术语。我们探索了所提框架中自动查询扩展方法(包括有反馈和无反馈查询扩展,以及简单 K 近邻的一种变体)的性能。在标准 TREC 即席数据(Disk 4, 5,查询集 301-450, 601-700)和网络数据(WT10G 数据,查询集 451-550)上的实验表明,相比标准的基于词项重叠的检索方法有显著改进。然而,所提方法未能达到与基于统计共现的反馈方法(如 RM3)相当的性能。我们还发现,基于 word2vec 的查询扩展方法在有反馈信息和无反馈信息的情况下表现相似。

关键词

引用

@article{arxiv.1606.07608,
  title  = {Using Word Embeddings for Automatic Query Expansion},
  author = {Dwaipayan Roy and Debjyoti Paul and Mandar Mitra and Utpal Garain},
  journal= {arXiv preprint arXiv:1606.07608},
  year   = {2016}
}

备注

5 pages, 3 tables, 1 figure. Neu-IR '16 SIGIR Workshop on Neural Information Retrieval July 21, 2016, Pisa, Italy