TermPicker:利用关联开放数据云中的数据实现词汇术语重用——扩展技术报告
数据库
2016-01-13 v2 信息检索
摘要
在将数据建模为关联开放数据(LOD)时,决定使用哪些词汇术语远非易事。选择过于通用的词汇术语,或其他LOD数据集未使用的词汇表中的术语,可能导致数据表示难以被人类理解,也难以被关联数据应用消费。在本技术报告中,我们提出TermPicker:一种通过基于利用LOD云上其他数据提供者如何使用RDF类型和属性来描述其数据的信息来推荐RDF类型和属性,从而实现词汇重用的新方法。为此,我们引入了所谓模式级模式(SLPs)的概念。它们捕获在一些数据集合(例如LOD云上的数据集)中,RDF类型集合如何通过属性集合相连接。TermPicker使用此类SLP并生成用于重用的词汇术语排序列表。推荐的术语列表由使用机器学习方法Learning To Rank (L2R)计算的排序模型排序。TermPicker基于使用平均精度均值(MAP)和前五个位置的平均倒数排名(MRR@5)衡量的推荐质量进行评估。我们的结果表明,与使用之前研究的仅推荐流行词汇术语或同一词汇表中术语的基线相比,使用SLP时推荐质量提高了29%–36%。整体最佳结果是将SLP与Learning To Rank算法Random Forests结合使用取得的。
引用
@article{arxiv.1512.05685,
title = {TermPicker: Enabling the Reuse of Vocabulary Terms by Exploiting Data from the Linked Open Data Cloud - An Extended Technical Report},
author = {Johann Schaible and Thomas Gottron and Ansgar Scherp},
journal= {arXiv preprint arXiv:1512.05685},
year = {2016}
}
备注
17 pages, 3 figures, extended technical report for a Conference Paper