中文

科学文献的实体集检索:一种无监督排序方法

信息检索 2018-05-01 v1

摘要

文献检索对任何科学研究都至关重要。与 Web 或通用领域检索不同,科学文献检索中的很大一部分查询是实体集查询,即可能属于不同类型的多个实体。实体集查询反映了用户查找包含多个实体并揭示实体间关系的文档的需求,从而对单独对每个实体进行建模的现有检索算法构成了非平凡的挑战。然而,实体集查询通常是稀疏的(即重复率不高),这使得许多严重依赖相关点击历史的监督排序模型效果不佳。为了应对这些挑战,我们引入了 SetRank,这是一个无监督排序框架,能够对实体间关系进行建模并捕获实体类型信息。此外,我们开发了一种基于加权排序聚合技术的新型无监督模型选择算法,无需依赖带标签的验证集即可自动选择 SetRank 中的参数设置。我们使用来自 TREC Genomics Tracks 和 Semantic Scholar 查询日志的数据集评估了所提出的无监督方法。实验表明,SetRank 显著优于基线无监督模型,尤其是在实体集查询上,并且我们的模型选择算法能够有效地选择合适的参数设置。

关键词

引用

@article{arxiv.1804.10877,
  title  = {Entity Set Search of Scientific Literature: An Unsupervised Ranking Approach},
  author = {Jiaming Shen and Jinfeng Xiao and Xinwei He and Jingbo Shang and Saurabh Sinha and Jiawei Han},
  journal= {arXiv preprint arXiv:1804.10877},
  year   = {2018}
}

备注

SIGIR 2018 Full Paper