容错高性能计算系统中的节能机会探索
分布式、并行与集群计算
2023-11-15 v2
摘要
如今,提升高性能计算(HPC)系统的能效是科技研究的主要驱动力之一。由于大规模 HPC 系统需要某种容错方法,应探索降低能耗的机会。特别是,使用非协调检查点的回滚恢复方法可防止所有进程在故障发生时重新执行。在此背景下,可以采取行动降低那些进程无需重新执行的节点的能耗。本文是一项前期工作的扩展,此前我们提出了一系列在故障时刻管理能耗的策略。在本工作中,我们通过纳入非阻塞通信(含与不含系统缓冲)以及更多待分析的候选进程,丰富了我们的模拟器与实验。我们将后者称为\textit{级联分析},因其包含了因通信而间接被故障进程阻塞的进程。仿真表明,最坏情况下节能可忽略不计,但在某些场景中可实现显著节能;在 16 分钟的时间区间内达成的最高节能为 90\%。结果表明,在存在故障的情况下提升 HPC 系统能效是可行的。
引用
@article{arxiv.2311.06419,
title = {Exploring Energy Saving Opportunities in Fault Tolerant HPC Systems},
author = {Marina Moran and Javier Balladini and Dolores Rexachs and Enzo Rucci},
journal= {arXiv preprint arXiv:2311.06419},
year = {2023}
}
备注
This is the accepted version of the manuscript that was sent to review to Journal of Parallel and Distributed Computing (ISSN 1096-0848). arXiv admin note: text overlap with arXiv:2012.11396