中文

双网时代下的实体排序——一种面向语义摘要的应用

信息检索 2019-05-01 v1

摘要

关联开放数据(Linked Open Data, LOD)倡议的进展正催生出一个更具结构化的数据网络。事实上,少数数据集(如 DBpedia)充当着连接众多其他数据集的枢纽。它们还使面向纯文本的实体检测新 Web 服务(如 DBpedia Spotlight)成为可能,从而允许那些能从文档网络与数据网络的结合中获益的新型应用得以涌现。为促进这些新型应用的出现,我们提出了一种面向查询偏置的算法(LDRANK),用于对具有关联文本数据的数据网络资源进行排序。该算法将链接分析与降维技术相结合。我们利用众包构建了一个公开可复用的数据集,用于评估网页中检测到的数据网络资源的查询偏置排序。我们表明,在该数据集上,LDRANK 优于现有最佳方法。最后,我们使用该算法构建语义摘要,并通过基于众包的方法评估了其有用性。

关键词

引用

@article{arxiv.1509.04525,
  title  = {Ranking Entities in the Age of Two Webs, an Application to Semantic Snippets},
  author = {Mazen Alsarem and Pierre-Edouard Portier and Sylvie Calabretto and Harald Kosch},
  journal= {arXiv preprint arXiv:1509.04525},
  year   = {2019}
}