Reshi:面向异构基础设施上科学工作流任务的资源推荐
分布式、并行与集群计算
2022-10-18 v2
摘要
科学工作流通常由大量不同的处理步骤组成,这些步骤常在对输入数据的不同分区上并行执行。而这些执行又必须调度到所用计算基础设施的计算节点上。该分配因以下事实而复杂化:(a) 任务通常具有高度异构的资源需求;(b) 在许多基础设施中,计算节点提供高度异构的资源。因此,许多调度算法所需的给定任务在给定节点上运行时的预测往往相当不精确,这可能导致次优的调度决策。我们提出 Reshi,一种在工作流执行期间推荐任务-节点分配的方法,可应对异构任务与异构节点。Reshi 将该问题视为回归任务,其中任务-节点对被建模为基于专用微基准测试结果和过往任务执行的特征向量。基于这些特征,Reshi 训练一个回归树模型,为每个就绪任务排序并推荐节点,可作为调度器的输入。在评估中,我们使用三个代表性工作流对 27 种 AWS 机器类型进行了基准测试。我们将 Reshi 的推荐与三种最先进调度器进行比较。评估表明,在平均任务运行时预测误差为 15% 的假设下,Reshi 相比 HEFT 平均完工时间缩短 7.18% 和 18.01%。
引用
@article{arxiv.2208.07905,
title = {Reshi: Recommending Resources for Scientific Workflow Tasks on Heterogeneous Infrastructures},
author = {Jonathan Bader and Fabian Lehmann and Alexander Groth and Lauritz Thamsen and Dominik Scheinert and Jonathan Will and Ulf Leser and Odej Kao},
journal= {arXiv preprint arXiv:2208.07905},
year = {2022}
}
备注
Paper accepted in 41st IEEE International Performance Computing and Communications Conference (IPCCC 2022)