高性能计算系统日志数据分析的整体方法:以 IBM Blue Gene/Q 为例
分布式、并行与集群计算
2015-09-08 v3
摘要
管理高性能计算基础设施的复杂性和成本正在上升。通过预测模型实现管理和修复的自动化,以尽量减少人工干预,是提高系统可用性并控制这些成本的一种尝试。构建足够准确以用于自动管理的预测模型,不能基于来自子系统的受限日志数据,而是需要对来自不同来源的数据进行整体分析。在此,我们提供了一项详细的多尺度表征研究,该研究基于四个数据集,报告了 IBM Blue Gene/Q 安装中的功耗、温度、工作负载以及硬件/软件事件。我们表明,该系统运行着丰富的并行工作负载,其组件在温度和功耗方面相关性较低,但在事件方面相关性较高。正如预期,功耗和温度 strongly 相关,而事件与工作负载和功耗呈负相关。功耗和工作负载仅在组件尺度上显示出中等相关性。本研究旨在对计算基础设施进行系统、综合的表征,发现相关性的来源和层级,为未来的预测建模工作奠定基础。
引用
@article{arxiv.1410.4449,
title = {A Holistic Approach to Log Data Analysis in High-Performance Computing Systems: The Case of IBM Blue Gene/Q},
author = {Alina Sîrbu and Ozalp Babaoglu},
journal= {arXiv preprint arXiv:1410.4449},
year = {2015}
}
备注
12 pages, 7 Figures