基于Darshan日志的HPC集群I/O突发预测
分布式、并行与集群计算
2023-08-22 v1 机器学习
网络与互联网体系结构
摘要
理解大规模HPC集群的全局I/O模式对于最小化I/O干扰的发生与影响至关重要。然而,该领域以往工作多聚焦于监测和预测任务级与节点级I/O突发事件。本文分析来自三台超级计算机的Darshan报告,以提取五分钟间隔的系统级读、写I/O速率。我们观察到三台集群中读、写I/O速率均存在显著(超过100倍)波动。随后我们训练机器学习模型,以提前5至120分钟估计系统级I/O突发的发生。评估结果显示,提前五分钟预测I/O突发的准确率(F-1分数)超过90%,提前两小时准确率超过87%。我们还表明,ML模型在估计I/O突发程度时准确率超过70%。我们认为高精度的I/O突发预测可有多种用途,例如推迟可延迟的I/O操作(如checkpointing)、暂停非必要应用(如文件系统清理器),以及设计感知I/O的作业调度方法。为验证此观点,我们模拟了一个可推迟应用启动时间以规避I/O突发的突发感知作业调度器。结果表明,突发感知作业调度可使应用运行时间最多减少5倍。
引用
@article{arxiv.2308.10311,
title = {I/O Burst Prediction for HPC Clusters using Darshan Logs},
author = {Ehsan Saeedizade and Roya Taheri and Engin Arslan},
journal= {arXiv preprint arXiv:2308.10311},
year = {2023}
}
备注
10 pages, 11 figures, 2 tables