中文

面向内存数据分析平台的工作负载特定内存容量配置方法

分布式、并行与集群计算 2017-12-18 v1

摘要

我们提出 WSMC,一种针对 Spark 工作负载的工作负载特定内存容量配置方法,它通过准确预测工作负载在不同输入数据规模和参数设置下的内存需求,指导用户进行内存容量配置。首先,WSMC 根据工作负载的数据膨胀比将其分为四类。其次,WSMC 综合考虑输入数据规模、shuffle 数据规模、工作负载并行度以及数据块大小,建立内存需求预测模型。最后,对于每类工作负载,WSMC 以工作负载特定的方式计算预测模型中的 shuffle 数据规模。对于即席工作负载,WSMC 可利用小规模输入数据剖析其数据膨胀比,并判定该工作负载所属类别。用户随后可依据相应的内存需求预测确定准确配置。通过基于 SparkBench 工作负载的综合评估,我们发现:与默认配置相比,在 WSMC 指导下进行的配置可节省超过 40% 的内存容量,且工作负载性能仅有轻微下降(仅 5%);与手动找到的合适配置相比,在 WSMC 指导下进行的配置仅导致内存浪费增加 7%,而工作负载性能略有提升(约 1%)。

关键词

引用

@article{arxiv.1712.05554,
  title  = {A Workload-Specific Memory Capacity Configuration Approach for In-Memory Data Analytic Platforms},
  author = {Yi Liang and Shilu Chang and Chao Su},
  journal= {arXiv preprint arXiv:1712.05554},
  year   = {2017}
}