近数据处理(Near Data Computing)对 Apache Spark 的潜力识别
分布式、并行与集群计算
2017-07-31 v1
摘要
尽管集群计算框架不断发展以提供实时数据分析能力,Apache Spark 凭借其作为批处理和流数据处理的统一框架,已在大数据分析领域处于前沿。由于过去十年的技术进步,近数据处理(Near Data Computing, NDC)也重新引起关注。然而,尚不清楚 NDC 架构能否提升诸如 Apache Spark 之类大数据处理框架的性能。在本立场论文中,我们通过对 Ivy Bridge 服务器上基于 Apache Spark 的工作负载进行广泛剖析,假设支持采用包含基于可编程逻辑的混合二维集成存内处理与存储内处理的 NDC 架构用于 Apache Spark。
引用
@article{arxiv.1707.09323,
title = {Identifying the potential of Near Data Computing for Apache Spark},
author = {Ahsan Javed Awan and Mats Brorsson and Vladimir Vlassov and Eduard Ayguade},
journal= {arXiv preprint arXiv:1707.09323},
year = {2017}
}
备注
position paper