Hadoop 中性能异常的表征
分布式、并行与集群计算
2015-05-14 v2
摘要
由于数据和大规模系统的高度多样性,对于这些系统不存在一种唯一能保证每个查询最佳性能的执行设置。在本项目中,我们尝试通过每次改变一个执行设置,研究不同执行设置对工作负载执行时间的影响。利用这些实验数据,构建了一棵决策树,其中每个内部节点代表执行参数,每个分支代表为该参数选择的值,每个叶节点代表以分钟为单位的执行时间范围。决策树中用于分割数据集的属性是基于最大信息增益或最低熵来选择的。一旦用训练样本训练好该树,便可利用该树得到期望执行时间的近似范围。当实际执行时间与该期望值不符时,便可检测到性能异常。对于一个包含 400 个样本的测试数据集,99% 的样本实际执行时间落在决策树预测的时间范围内。此外,通过分析构建的树,可以了解对于给定工作负载何种配置能带来更好性能。初步实验表明,执行参数对目标属性(此处为执行时间)的影响可能与该特征节点距所构建决策树根节点的距离有关。初步结果显示,对于靠近根节点的特征节点,其不同取值下目标属性值的百分比变化是当该相同 iii 特征节点远离根节点时的 6 倍。这一观察取决于决策树的训练效果,且未必适用于所有情况。
引用
@article{arxiv.1505.01919,
title = {Characterization of Performance Anomalies in Hadoop},
author = {Puja Gupta},
journal= {arXiv preprint arXiv:1505.01919},
year = {2015}
}