大数据处理程序的抽象视图
软件工程
2021-08-06 v1 分布式、并行与集群计算
摘要
本文提出一种用于指定基于数据流并行数据处理程序且独立于目标大数据处理框架的模型。论文聚焦于非迭代与迭代程序的形式化抽象规范,推广了数据流大数据处理框架所采用的策略。所提模型依赖幺半群代数与Petri网,在两个层次上抽象大数据处理程序:表示程序数据流的高层,以及表示数据转换操作(如过滤、聚合、连接)的低层。我们扩展了[1]中提出的程序处理模型,以支持迭代程序的使用。鉴于迭代与贪心大数据分析算法的普及,对由基于数据流的并行编程模型实现的迭代数据处理程序给出通用规范至关重要。事实上,这些算法要求重新审视并行编程模型以表达迭代。本文对Apache Spark、DryadLINQ、Apache Beam与Apache Flink提出的迭代策略进行了比较分析,并讨论了该模型如何成功推广这些策略。
引用
@article{arxiv.2108.02582,
title = {An Abstract View of Big Data Processing Programs},
author = {Joao Batista de Souza Neto and Anamaria Martins Moreira and Genoveva Vargas-Solar and Martin A. Musicante},
journal= {arXiv preprint arXiv:2108.02582},
year = {2021}
}
备注
This is an extended version of Modeling Big Data Processing Programs, by Joao Batista de Souza Neto, Anamaria Martins Moreira, Genoveva Vargas-Solar and Martin A. Musicante. SBMF 2020