向 word2vec 中融入相关文档的探索
信息检索
2018-04-05 v2 计算与语言
摘要
神经词嵌入的最新进展为各种信息检索(IR)任务带来了显著益处。然而,正如近期研究所表明的,将嵌入模型适配IR任务的需求可带来可观的进一步改进。嵌入模型通常通过利用词在短窗口上下文中的共现来定义词项相关性。在IR中,查询相关词项的另一种(且被广泛研究的)方法是利用局部信息,即一组检索排名靠前的文档。鉴于这两种词项相关性方法,在本研究中,我们报告了将查询的局部信息融入词嵌入的研究。该方向的一个主要挑战是,词嵌入的稠密向量及其对词项间相关性的估计仍然难以解释且难以分析。作为替代,显式词表示提出了维度易于解释的向量,且近期方法表现出与稠密向量相当的竞争力。我们引入了一种基于神经的显式表示,其植根于word2vec Skip-Gram模型的概念思想。该方法在保持Skip-Gram模型有效性的同时,提供了可解释的显式向量。在词关联集合上对各种显式表示的评估表明,在高度相似词项的排序任务中,新提出的方法优于state-of-the-art的显式表示。基于引入的显式表示,我们讨论了将局部文档融入全局训练嵌入模型的方法,并讨论了初步结果。
引用
@article{arxiv.1707.06598,
title = {Toward Incorporation of Relevant Documents in word2vec},
author = {Navid Rekabsaz and Bhaskar Mitra and Mihai Lupu and Allan Hanbury},
journal= {arXiv preprint arXiv:1707.06598},
year = {2018}
}
备注
Neu-IR Workshop at the ACM Conference on Research and Development in Information Retrieval (NeuIR-SIGIR 2017)