中文

RDF 图中频繁星型模式的压缩

数据库 2020-03-12 v1

摘要

知识图谱已成为一种利用图数据模型(例如资源描述框架(RDF))表示实体及其属性的流行形式。RDF 图包含同类型实体,这些实体通过标注了属性的带标签边连接到对象或其他实体。RDF 图通常包含在某些属性组中共享相同对象的实体,即它们匹配由这些属性和对象组成的星型模式。若这些星型模式中的实体或属性数量很大,RDF 图的大小和查询处理会受到负面影响;我们将这些星型模式称为频繁星型模式。我们解决在 RDF 图中识别频繁星型模式的问题,并设计了因子化 RDF 图的概念,它表示频繁星型模式数量被最小化的 RDF 图的紧凑表示。我们还开发了识别频繁星型模式并生成因子化 RDF 图的计算方法,其中紧凑的 RDF 分子替代了频繁星型模式。频繁星型模式的紧凑 RDF 分子表示一个实例化相应星型模式的 RDF 子图。不再让所有匹配原始频繁星型模式的实体出现,而是添加一个代理实体并关联到频繁星型模式的属性;该代理实体链接到原本匹配频繁星型模式的实体。我们在多个 RDF 图基准上评估了因子化技术的性能,并与基于 gSpan(一种用于检测频繁模式的最先进算法)构建的基线进行比较。结果证明了所提方法的效率,并表明我们的技术能够将基线方法的执行时间减少至少三个数量级,同时将 RDF 图大小减少多达 66.56%。

关键词

引用

@article{arxiv.2003.05238,
  title  = {Compacting Frequent Star Patterns in RDF Graphs},
  author = {Farah Karim and Maria-Esther Vidal and Sören Auer},
  journal= {arXiv preprint arXiv:2003.05238},
  year   = {2020}
}