Hadoop MapReduce 性能调优:一种噪声梯度方法
分布式、并行与集群计算
2019-08-28 v2 机器学习
摘要
Hadoop MapReduce 是一个在大数据分析中相当流行的分布式存储和处理大型数据集的框架。它具有各种配置参数(旋钮),这些参数在决定性能(即给定大数据处理作业的执行时间)方面起着重要作用。这些参数的默认值并不总能带来良好的性能,因此对其进行调优至关重要。然而,由于两个重要原因,参数调优存在固有的困难——首先,参数搜索空间很大;其次,存在跨参数交互。因此,需要一种无维度的方法,能够通过考虑跨参数依赖性来自动调优配置参数。在本文中,我们提出了一种新颖的 Hadoop 参数调优方法,该方法基于一种称为同时扰动随机逼近(SPSA)的噪声梯度算法。SPSA 算法通过直接观察 Hadoop MapReduce 系统的性能来调优参数。所遵循的方法独立于参数维度,并且在调优时每次迭代仅需要 2 次观测。我们证明了我们的方法在流行的 Hadoop 基准测试(即 Grep、Bigram、Inverted Index、Word Co-occurrence 和 Terasort)上实现良好性能的有效性。当在一个 25 节点的 Hadoop 集群上进行测试时,我们的方法与默认配置相比,平均减少了 Hadoop 作业 66% 的执行时间。此外,我们还观察到与先前方法相比,执行时间减少了 45%。
引用
@article{arxiv.1611.10052,
title = {Performance Tuning of Hadoop MapReduce: A Noisy Gradient Approach},
author = {Sandeep Kumar and Sindhu Padakandla and Chandrashekar L and Priyank Parihar and K Gopinath and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:1611.10052},
year = {2019}
}