利用概率近似评估关联数据集的质量
数据库
2015-03-18 v1 数据结构与算法
摘要
随着关联开放数据 (Linked Open Data) 应用的日益广泛,通过计算质量指标来评估数据集的质量成为一个至关重要的问题。对于大规模且不断演变的数据集,精确且确定性地计算质量指标过于耗时或昂贵。我们采用储层抽样 (Reservoir Sampling)、布隆过滤器 (Bloom Filters) 和聚类系数估计等概率技术,以近似但足够准确的方式实现了一套广泛的数据质量指标。我们的实现已集成到综合数据质量评估框架 Luzzu 中。我们在具有广泛相关性的关联开放数据集上评估了其性能和准确性。
引用
@article{arxiv.1503.05157,
title = {Quality Assessment of Linked Datasets using Probabilistic Approximation},
author = {Jeremy Debattista and Santiago Londoño and Christoph Lange and Sören Auer},
journal= {arXiv preprint arXiv:1503.05157},
year = {2015}
}
备注
15 pages, 2 figures, To appear in ESWC 2015 proceedings