中文

神经网络词嵌入中的不确定性:相似度阈值的探索

计算与语言 2018-04-05 v2 信息检索

摘要

词嵌入,特别是随着其近期的发展,有望对术语之间的相似度进行量化。然而,目前尚不清楚这种相似度值在多大程度上能真正具有意义并对后续任务有用。我们探讨了从模型中获得的相似度得分在多大程度上能真正指示术语的相关性。我们首先观察并量化了词嵌入模型在相似度值方面的不确定性因素。基于该因素,我们在不同维度上引入了一个通用阈值,能够有效过滤出高度相关的术语。我们在四个信息检索数据集上的评估验证了该方法的有效性,引入阈值后的结果显著优于基线,同时等于或在统计上无法区分于最优结果。

关键词

引用

@article{arxiv.1606.06086,
  title  = {Uncertainty in Neural Network Word Embedding: Exploration of Threshold for Similarity},
  author = {Navid Rekabsaz and Mihai Lupu and Allan Hanbury},
  journal= {arXiv preprint arXiv:1606.06086},
  year   = {2018}
}

备注

Neu-IR Workshop at the ACM Conference on Research and Development in Information Retrieval (NeuIR-SIGIR 2016)