Karasu:一种面向大数据分析的高效集群配置的协作方法
分布式、并行与集群计算
2023-11-27 v2 机器学习
摘要
为大数据分析作业选择合适的资源是困难的,因为存在机器类型和集群规模等多种配置选项。由于糟糕的选择会对资源效率、成本和能耗产生显著影响,自动化方法正日益流行。大多数现有方法依赖于对重复工作负载进行性能剖析,以随时间找到近似最优解。由于冷启动问题,这常常导致漫长且昂贵的剖析阶段。然而,不同用户的大数据分析作业可以共享许多共同属性:它们通常在相似的基础设施上运行,使用在相似框架中实现的相似算法。共享聚合的剖析运行以协作解决冷启动问题的潜力在很大程度上尚未被探索。我们提出 Karasu,一种更高效的资源配置剖析方法,它促进在相似基础设施、框架、算法或数据集上工作的用户之间的数据共享。Karasu 利用协作者的聚合运行时信息训练轻量级性能模型,并将其组合为集成方法,以利用配置搜索空间的固有知识。此外,Karasu 允许同时优化多个目标。我们的评估基于公共云环境中多样化工作负载执行的性能数据。我们表明,即使只有少量与目标作业仅有部分共同特征的可比剖析运行可用,Karasu 也能在性能、搜索时间和成本方面显著增强现有方法。
引用
@article{arxiv.2308.11792,
title = {Karasu: A Collaborative Approach to Efficient Cluster Configuration for Big Data Analytics},
author = {Dominik Scheinert and Philipp Wiesner and Thorsten Wittkopp and Lauritz Thamsen and Jonathan Will and Odej Kao},
journal= {arXiv preprint arXiv:2308.11792},
year = {2023}
}
备注
10 pages, 9 figures