预测批处理队列作业等待时间以实现紧急 HPC 工作负载的知情调度
分布式、并行与集群计算
2022-04-29 v1 机器学习
摘要
将 HPC 机器用于紧急工作负载以协助应对突发灾害的兴趣日益增长。尽管批处理队列系统在支持此类工作负载方面并不理想,但通过准确预测等待作业何时开始运行,许多缺点可以被规避。然而,实现高精度的此类预测面临诸多挑战,尤其是队列状态可能快速变化并依赖于众多因素。在本工作中,我们探索了一种用于预测队列等待时间的新型机器学习方法,假设此类模型能够捕捉由队列策略及其他交互产生的复杂行为,从而生成准确的作业开始时间。针对 ARCHER2 (HPE Cray EX)、Cirrus (HPE 8600) 和 4-cabinet (HPE Cray EX),我们探究了不同的机器学习方法与技术如何提升预测精度,并与 Slurm 生成的估计进行比较。我们证明,我们的技术在所关注的机器上提供了最准确的预测:在 ARCHER2 和 4-cabinet 上约 65% 的作业以及 Cirrus 上 76% 的作业,其预测作业开始时间与实际开始时间的误差在一分钟以内。与 Slurm 所能提供的相比,这在 ARCHER2 上约提升了 3.8 倍精度,在 Cirrus 上提升了 18 倍。此外,我们的方法能在 ARCHER2 和 4-cabinet 上于实际开始时间十分钟以内准确预测四分之三作业、在 Cirrus 上 90% 作业的开始时间。尽管本工作的驱动力是更好地促进紧急工作负载在 HPC 机器上的放置,所获得的见解可用于为用户提供更广泛的益处,并丰富现有批处理队列系统及为策略制定提供参考。
引用
@article{arxiv.2204.13543,
title = {Predicting batch queue job wait times for informed scheduling of urgent HPC workloads},
author = {Nick Brown and Gordon Gibb and Evgenij Belikov and Rupert Nash},
journal= {arXiv preprint arXiv:2204.13543},
year = {2022}
}
备注
Preprint of article at the 2022 Cray User Group (CUG)