预测 MapReduce 作业总累积 CPU 使用量的统计回归方法
摘要
近年来,企业已开始将 MapReduce 作为一种流行的计算框架,在公有云和私有云中处理大量数据,如垃圾邮件检测及各种数据挖掘任务。此类环境中的两个具有挑战性的问题是:(1) 为 MapReduce 配置参数选择合适的值,例如 mapper 数量、reducer 数量和 DFS 块大小;(2) 预测用户应向服务提供商租赁的资源量。目前,选择配置参数和估计所需资源的任务完全由用户负责。在本文中,我们提出了一种方法,用于预测 MapReduce 环境中作业以时钟周期为单位的总 CPU 使用量。对于 MapReduce 作业,根据该作业在过去使用两个配置参数(例如 mapper 数量和 reducer 数量)不同值执行的历史记录,构建以时钟周期为单位的总 CPU 使用量配置文件。然后,使用多项式回归对这些配置参数与作业以时钟周期为单位的总 CPU 使用量之间的关系进行建模。我们还简要研究了输入数据缩放对测得的以时钟周期为单位的总 CPU 使用量的影响。该导出模型连同缩放结果,可用于预测相同作业在不同输入数据大小下以时钟周期为单位的总 CPU 使用量。我们使用三个实际应用(WordCount、Exim MainLog 解析和 TeraSort)验证了模型的准确性。结果表明,在 20 节点虚拟 Hadoop 集群中,所生成的资源配置选项预测的以时钟周期为单位的总 CPU 使用量与测得的以时钟周期为单位的总 CPU 使用量相比,误差小于 8%。
引用
@article{arxiv.1303.3632,
title = {Statistical Regression to Predict Total Cumulative CPU Usage of MapReduce Jobs},
author = {Nikzad Babaii Rizvandi and Javid Taheri and Reza Moraveji and Albert Y. Zomaya},
journal= {arXiv preprint arXiv:1303.3632},
year = {2013}
}
备注
16 pages- previously published as "On Modelling and Prediction of Total CPU Usage for Applications in MapReduce Enviornments" in IEEE 12th International Conference on Algorithms and Architectures for Parallel Processing (ICA3PP-12), Fukuoka, Japan, 4-7 September, 2012