中文

一种可扩展的RDF数据集质量评估框架

数据库 2020-01-31 v1 性能

摘要

过去几年中,关联数据持续增长。如今,我们统计到已有超过 10,000 个遵循关联数据标准的数据集可在线获取。这些标准使数据具备机器可读性与互操作性。然而,若关联数据质量低下,许多应用(如数据集成、检索与互联)便无法充分利用其优势。现有若干关联数据质量评估方法,但其性能随数据规模增大而下降,并迅速超出单机处理能力。本文提出 DistQualityAssessment——一种大规模 RDF 数据集质量评估的开源实现,可横向扩展至机器集群。这是首个使用 Apache Spark 计算大规模 RDF 数据集不同质量指标的分布式内存方法。我们还提供一套质量评估模式,可用于生成可应用于大数据的新可扩展指标。本文工作已集成于 SANSA 框架,并在 SANSA 社区之外的至少三个用例中得到应用。结果表明,与已有方法相比,我们的方法更具通用性、高效性与可扩展性。

关键词

引用

@article{arxiv.2001.11100,
  title  = {A Scalable Framework for Quality Assessment of RDF Datasets},
  author = {Gezim Sejdiu and Anisa Rula and Jens Lehmann and Hajira Jabeen},
  journal= {arXiv preprint arXiv:2001.11100},
  year   = {2020}
}

备注

International Semantic Web Conference (ISWC 2019)