中文

弥合鸿沟:引入语义相似度度量以有效映射 PubMed 查询到文档

计算与语言 2017-10-19 v2 信息检索

摘要

传统信息检索(IR)的主要方法是检查查询中有多少词出现在文档中。然而,这种方法的缺点在于可能无法检测到仅找到极少查询词或没有查询词的相关文档。诸如 LSA(潜在语义分析)和 LDA(潜在狄利克雷分配)等语义分析方法已被提出以解决该问题,但其性能并不优于常见的 IR 方法。本文提出一种受词移距离(Word Mover's Distance)启发的查询-文档相似度度量。与其他相似度度量不同,所提方法依赖神经词嵌入来计算词间距离。当查询与文档间无直接匹配时,该过程有助于识别相关词。我们的方法高效且易于实现。在 TREC Genomics 数据上的实验结果表明,我们的方法在平均精度均值上比 BM25 排序函数高出平均 12%。此外,对于从 PubMed 搜索日志收集的真实世界数据集,我们使用学习排序方法将语义度量与 BM25 结合,使排序分数提升高达 25%。该实验表明所提方法与 BM25 良好互补,共同产生更优性能。

关键词

引用

@article{arxiv.1608.01972,
  title  = {Bridging the Gap: Incorporating a Semantic Similarity Measure for Effectively Mapping PubMed Queries to Documents},
  author = {Sun Kim and Nicolas Fiorini and W. John Wilbur and Zhiyong Lu},
  journal= {arXiv preprint arXiv:1608.01972},
  year   = {2017}
}

备注

10 pages, 1 figure, 3 tables