中文

将知识图谱创建扩展至大规模异构数据源

人工智能 2022-10-27 v3 数据库

摘要

RDF 知识图谱(KG)是表示由异构数据源创建的事实陈述的强大数据结构。知识图谱的创建过程繁重,需要高效执行的数据管理技术。本文解决的是以声明方式指定的知识图谱创建流程的自动生成问题;它提出了根据 RDF 映射语言(RML)中指定的映射断言,将异构数据规划并转换为 RDF 三元组的技术。给定一组映射断言,规划器通过对断言的执行进行分区和调度,提供一个优化的执行计划。首先,规划器根据数据源数量、映射断言类型以及不同断言之间的关联,评估一个优化的分区数量。在提供分区列表及属于每个分区的断言后,规划器确定它们的执行顺序。实现了一个贪心算法来生成分区的丛生树执行计划。丛生树计划被转换为操作系统命令,这些命令按照丛生树指示的顺序指导映射断言分区的执行。所提出的优化方法在符合 RML 标准的最先进引擎以及现有的数据源和 RML 三元组映射基准上进行了评估。我们的实验结果表明,所研究引擎的性能可以得到显著提升,尤其是在具有大量三元组映射和大规模数据源的复杂场景中。因此,在复杂情况下会超时的引擎能够应用该规划器至少生成知识图谱的一部分。

关键词

引用

@article{arxiv.2201.09694,
  title  = {Scaling Up Knowledge Graph Creation to Large and Heterogeneous Data Sources},
  author = {Enrique Iglesias and Samaneh Jozashoori and Maria-Esther Vidal},
  journal= {arXiv preprint arXiv:2201.09694},
  year   = {2022}
}