Shark:大规模SQL与丰富分析
数据库
2012-11-28 v1
摘要
Shark是一个新型数据分析系统,它将查询处理与大规模集群上的复杂分析相结合。它利用一种新颖的分布式内存抽象,提供了一个统一引擎,能够大规模运行SQL查询和复杂的分析函数(例如迭代机器学习),并在查询中间高效地从故障中恢复。这使得Shark运行SQL查询的速度比Apache Hive快100倍,运行机器学习程序的速度比Hadoop快100倍。与之前的系统不同,Shark表明,在保留类似MapReduce的执行引擎以及此类引擎提供的细粒度容错特性的同时,可以实现这些加速。它通过多种方式扩展了这种引擎,包括面向列的存储和动态的查询中重规划,以有效执行SQL。结果是一个系统,其加速比与MPP分析数据库相对于MapReduce的报告相当,同时提供了它们所缺乏的容错特性和复杂分析能力。
引用
@article{arxiv.1211.6176,
title = {Shark: SQL and Rich Analytics at Scale},
author = {Reynold Xin and Josh Rosen and Matei Zaharia and Michael J. Franklin and Scott Shenker and Ion Stoica},
journal= {arXiv preprint arXiv:1211.6176},
year = {2012}
}