面向全内存 RDF 管理的压缩垂直划分
数据库
2013-10-22 v2 数据结构与算法
信息检索
摘要
数据网 (Web of Data) 发展势头强劲,导致遵循 RDF 模型(基于主语、谓语和宾子的原子三元组单元)发布的半结构化数据集日益增多。尽管该模型简单,但由于数据集规模不断扩大,且在其组织和存储周围出现各种可扩展性问题,压缩方法变得必不可少。对于 RDF 存储而言,这一要求更为严格,因为还需要在压缩的 RDF 数据集上高效解析 SPARQL 查询。本文介绍了一种新颖的 RDF 索引技术(称为 k2-triples),支持在压缩空间内高效解析 SPARQL。k2-triples 利用谓语将数据集垂直划分为不相交的(主语,宾语)对子集,每个谓语对应一个子集。这些子集被表示为二进制矩阵,其中 1 位表示数据集中存在对应的三元组。该模型产生非常稀疏的矩阵,可使用 k2-trees 进行高效压缩。我们通过两个紧凑索引增强了该模型,这两个索引列出了与每个不同主语和宾语相关的谓语,以解决垂直划分表示法的特定弱点。所得技术不仅实现了迄今为止压缩率最高的表示,而且在我们实验中取得了最佳的 RDF 检索整体性能。我们的方法所用空间比最先进基线少达 10 倍,并在最基本的查询模式上将其性能提高了几个数量级。此外,我们优化了 k2-triples 上的传统连接算法,并利用其特定特征定义了一种新算法。实验结果表明,我们的技术在解决连接查询方面克服了传统垂直划分方法,在提供非连接节点的情况下报告了最佳的连接数据,并且在大多数情况下具有竞争力。
引用
@article{arxiv.1310.4954,
title = {Compressed Vertical Partitioning for Full-In-Memory RDF Management},
author = {Sandra Álvarez-García and Nieves R. Brisaboa and Javier D. Fernández and Miguel A. Martínez-Prieto and Gonzalo Navarro},
journal= {arXiv preprint arXiv:1310.4954},
year = {2013}
}