Hadoop 与 Spark 参数的自动调优
分布式、并行与集群计算
2021-11-05 v1
摘要
数量级达到太字节、拍字节或更高的数据被称为大数据。此类数据无法使用传统数据库软件进行处理,因此产生了对大数据平台的需求。大数据平台通过结合各种大数据应用和工具的功能与特性,形成单一解决方案。它是一个帮助开发、部署和管理大数据环境的平台。Hadoop 和 Spark 是 Apache 提供的两个开源大数据平台。这两个平台具有许多配置参数,这些参数可能对执行时间、准确性等产生不可预见的影响。手动调优这些参数可能令人疲惫,因此需要自动方式对其进行调优。在研究和分析先前关于自动化调优这些参数的各项工作后,本文提出了两种算法——带精细调优的网格搜索和受控随机搜索。本文研究的性能指标是执行时间。这些算法有助于自动调优参数。实验结果表明,使用带精细调优的网格搜索和受控随机搜索,Hadoop 的执行时间分别减少了约 70% 和 50%,Spark 的执行时间分别减少了 81.19% 和 77.77%。
引用
@article{arxiv.2111.02604,
title = {Auto Tuning of Hadoop and Spark parameters},
author = {Tanuja Patanshetti and Ashish Anil Pawar and Disha Patel and Sanket Thakare},
journal= {arXiv preprint arXiv:2111.02604},
year = {2021}
}
备注
12 Pages, 9 Figures, 12 Tables, Published with International Journal of Engineering Trends and Technology (IJETT)