中文

面向原始数据有效查询处理的工作负载驱动垂直分区

数据库 2015-05-12 v2

摘要

传统数据库缺乏处理“大数据”体量和多样性的适当功能。即使是最基本的查询会话,也需要严格的模式定义和数据加载作为先决条件。原始数据处理已被提出作为一种按需模式的替代方案,可提供对数据的即时访问。当加载成为选项时,它完全由当前运行的查询驱动,导致在整个查询工作负载下的性能次优。本文研究了具有部分加载的工作负载驱动原始数据处理问题。我们将建模为完全复制的二元垂直分区。我们提供了一个线性混合整数规划优化公式,并证明其为 NP 难问题。我们设计了一种两阶段启发式算法,能在极短时间内得到接近最优解的结果。我们将该优化公式和启发式算法扩展至流水线式原始数据处理场景,其中数据访问和提取并发执行。我们提供了三个基于真实数据格式的案例研究,证实了该模型在应用于最先进的原始数据处理流水线算子时的准确性。

关键词

引用

@article{arxiv.1503.08946,
  title  = {Workload-Driven Vertical Partitioning for Effective Query Processing over Raw Data},
  author = {Weijie Zhao and Yu Cheng and Florin Rusu},
  journal= {arXiv preprint arXiv:1503.08946},
  year   = {2015}
}