中文

BigDAWG 多存储系统与架构

数据库 2016-12-13 v1

摘要

组织常常面临为大型、异构数据集提供数据管理解决方案的挑战,这些数据集可能具有不同的底层数据模型和编程模型。例如,一个医疗数据集可能包含非结构化文本、关系数据、时间序列波形和图像。试图将此类数据集强行纳入单一数据管理系统可能会对性能和效率产生不利影响。作为 Intel 大数据科学与技术中心的一部分,我们正在开发一种针对此类问题设计的多存储系统。BigDAWG(Big Data Analytics Working Group 的缩写)是一种多存储系统,旨在处理自然跨越不同处理或存储引擎的复杂问题。BigDAWG 提供了一种支持使用不同数据模型的多种数据库系统的架构,通过岛屿支持位置透明性和语义完备性这两个竞争性概念,并提供中间件以实现统一的多岛屿接口。将 BigDAWG 系统原型应用于医疗数据集的初步结果验证了多存储概念。在本文中,我们将描述多存储数据库、当前的 BigDAWG 架构及其在 MIMIC II 医疗数据集上的应用、初步性能结果以及我们未来的开发计划。

关键词

引用

@article{arxiv.1609.07548,
  title  = {The BigDAWG Polystore System and Architecture},
  author = {Vijay Gadepally and Peinan Chen and Jennie Duggan and Aaron Elmore and Brandon Haynes and Jeremy Kepner and Samuel Madden and Tim Mattson and Michael Stonebraker},
  journal= {arXiv preprint arXiv:1609.07548},
  year   = {2016}
}

备注

6 pages, 5 figures, IEEE High Performance Extreme Computing (HPEC) conference 2016