基于 LSM 的 Apache AsterixDB 元组压缩框架(扩展版)
数据库
2020-05-12 v2
摘要
文档数据库系统以“原样”方式存储自描述半结构化记录(如 JSON),无需用户预定义模式。这为用户提供了灵活性,可更改传入记录的结构而无需担心系统离线或影响正在运行查询的性能。然而,此类系统的灵活性并非没有代价。记录中的大量冗余会带来不必要的存储开销并影响查询性能。本文的重点是通过引入一个元组压缩器框架来解决存储开销问题,该框架在数据摄取过程中从自描述半结构化记录推断并提取模式。由于许多知名的文档存储系统(如 MongoDB 和 Couchbase)在其存储引擎中采用日志结构合并(LSM)树,我们的框架利用 LSM 生命周期事件来附带进行模式推断与提取操作。我们已在 Apache AsterixDB 中实施并通过实证评估了我们的方法,以衡量其对存储、数据摄取和查询性能的影响。
引用
@article{arxiv.1910.08185,
title = {An LSM-based Tuple Compaction Framework for Apache AsterixDB (Extended Version)},
author = {Wail Y. Alkowaileet and Sattam Alsubaiee and Michael J. Carey},
journal= {arXiv preprint arXiv:1910.08185},
year = {2020}
}
备注
18 pages, 28 figures, to appear in VLDB 2020