中文

HDTCat:让 HDT 实现可扩展

数据库 2018-09-20 v1

摘要

HDT(Header, Dictionary, Triples)是一种 RDF 序列化格式。HDT 近年来非常流行,因为它能以极小的磁盘占用存储 RDF 数据,同时仍可查询。因此,在可扩展性成为问题时,HDT 常被使用。一旦 RDF 数据被序列化为 HDT,其存储的磁盘占用和查询的内存占用都非常低。然而,从原始文本 RDF 序列化格式(如 N-Triples)生成 HDT 文件是一项耗时且(尤其是)耗内存的任务。在本文中,我们提出 HDTCat,一种以低内存占用合并两个 HDT 文件的算法与命令行工具。HDTCat 可用于分治策略,以低内存占用从海量数据集生成 HDT 文件。

关键词

引用

@article{arxiv.1809.06859,
  title  = {HDTCat: let's make HDT scale},
  author = {Dennis Diefenbach and Josée M. Giménez-García},
  journal= {arXiv preprint arXiv:1809.06859},
  year   = {2018}
}