基于无监督关键绩效指标的高性能计算数据中心作业聚类
分布式、并行与集群计算
2023-12-12 v1 人工智能
摘要
性能分析是高性能计算(HPC)系统中的一项基本任务,其应用目的多样,例如异常检测、最优资源分配和预算规划。HPC监控任务会产生大量的关键绩效指标(KPIs),用以监督在这些系统中运行的作业的状态。KPIs提供关于CPU使用率、内存使用率、网络(接口)流量或其他监控硬件的传感器的数据。通过分析这些数据,可以获取有关运行作业的深刻信息,例如其特征、性能和故障。本文的主要贡献在于识别出哪一个/哪些指标(KPIs)最适合根据作业在HPC系统中的行为来识别/分类不同类型的作业。为此,我们使用来自加利西亚计算中心(CESGA)的真实数据集,应用了不同的聚类技术(划分聚类和层次聚类算法)。我们得出结论:(i) 与网络(接口)流量监控相关的那些指标(KPIs)为HPC作业聚类提供了最佳的凝聚度和分离度,并且 (ii) 层次聚类算法最适合这项任务。我们的方法使用来自同一HPC中心的另一个真实数据集进行了验证。
引用
@article{arxiv.2312.06546,
title = {Unsupervised KPIs-Based Clustering of Jobs in HPC Data Centers},
author = {Mohamed S. Halawa and Rebeca P. Díaz-Redondo and Ana Fernández-Vilas},
journal= {arXiv preprint arXiv:2312.06546},
year = {2023}
}
备注
22 pages, 6 figures, journal