中文

Web 数据索引:数据搜索中模式级索引的比较——扩展技术报告

数据库 2020-06-15 v1

摘要

对数据万维网(Web of Data)建立索引提供了诸多机遇,特别是用于发现和探索数据源。在对数据万维网建立索引时,一个主要的设计决策是找到合适的索引模型,即如何对数据进行索引与摘要。已有多种工作针对特定任务开发专门的索引模型。由于每个索引模型独立设计、实现和评估,难以判断某种方法是否能良好地推广到另一任务、查询集或数据集。在本工作中,我们实证评估了六种具有独特特征组合的代表性索引模型,其中包括一种融合基于 RDFS 与 owl:sameAs 推理的新索引模型。我们首次将所有索引模型实现于一个统一的、基于流的框架中。我们考虑在两组大型真实数据集上大小为 0、1 和 2 跳的子图,评估各索引模型的变体。我们从压缩比、摘要比以及表示基于流索引计算近似质量的 F1 分数来评价索引质量。实验揭示了不同索引模型、查询和数据集在压缩比、摘要比和近似质量上的巨大差异。然而,我们观察到结果中存在有意义的相关性,有助于针对给定任务、查询类型和数据集中确定合适的索引模型。

关键词

引用

@article{arxiv.2006.07064,
  title  = {Indexing Data on the Web: A Comparison of Schema-level Indices for Data Search -- Extended Technical Report},
  author = {Till Blume and Ansgar Scherp},
  journal= {arXiv preprint arXiv:2006.07064},
  year   = {2020}
}

备注

Extended technical report of an accepted paper in Database and Expert Systems Applications (DEXA) 2020