中文

分析型数据库架构时代的终结

数据库 2012-09-10 v1 分布式、并行与集群计算

摘要

传统的企业仓库解决方案围绕着一个单体且缺乏灵活性的分析型数据库系统构建:数据在分析之前需要被提取、转换并加载到刚性的关系形式中。配置和部署一个仓库需要数年的复杂规划;向现有仓库添加新的硬件资源同样是一项漫长而艰巨的任务。此外,现代数据分析采用的统计方法远超仓库系统提供的典型汇总和钻取能力。虽然可以使用 SQL 和用户定义函数 (UDF) 的组合来实现此类方法,但关系数据库中的查询引擎并不适合这些操作。Hadoop 生态系统引入了一套数据分析工具,克服了传统解决方案的一些问题。然而,这些系统放弃了多年的仓库研究成果。Hadoop 集群中的内存利用率显著不足,且其执行引擎与关系型对应物相比显得幼稚。现在是重新思考数据仓库系统设计并汲取双方长处的时候了。新一代仓库系统应是模块化、高性能、容错、易于配置,并设计为同时支持 SQL 查询处理和机器学习应用。本文引用了伯克利开发的 Shark 系统作为初步尝试。

关键词

引用

@article{arxiv.1209.1425,
  title  = {The End of an Architectural Era for Analytical Databases},
  author = {Reynold S. Xin},
  journal= {arXiv preprint arXiv:1209.1425},
  year   = {2012}
}