中文

利用概率近似评估关联数据集的质量

数据库 2015-03-18 v1 数据结构与算法

摘要

随着关联开放数据 (Linked Open Data) 应用的日益广泛,通过计算质量指标来评估数据集的质量成为一个至关重要的问题。对于大规模且不断演变的数据集,精确且确定性地计算质量指标过于耗时或昂贵。我们采用储层抽样 (Reservoir Sampling)、布隆过滤器 (Bloom Filters) 和聚类系数估计等概率技术,以近似但足够准确的方式实现了一套广泛的数据质量指标。我们的实现已集成到综合数据质量评估框架 Luzzu 中。我们在具有广泛相关性的关联开放数据集上评估了其性能和准确性。

关键词

引用

@article{arxiv.1503.05157,
  title  = {Quality Assessment of Linked Datasets using Probabilistic Approximation},
  author = {Jeremy Debattista and Santiago Londoño and Christoph Lange and Sören Auer},
  journal= {arXiv preprint arXiv:1503.05157},
  year   = {2015}
}

备注

15 pages, 2 figures, To appear in ESWC 2015 proceedings