MPCDF HPC 性能监控系统:通过作业级分析提供洞察
分布式、并行与集群计算
2019-09-27 v1
摘要
本文报道了在高斯 Planck 计算与数据设施(MPCDF)的 HPC 系统上部署的 HPC 性能监控系统的设计与实现,该系统用于持续监控所有作业的性能指标。由此,它向各类利益相关者揭示了重要信息,特别是用户、应用支持人员、系统管理员和管理层。在每个计算节点上,硬件和软件性能监控数据由我们新开发的、基于标准 Linux 工具构建的轻量级开源 hpcmd 中间件收集。数据通过 rsyslog 传输,并由 Splunk 系统聚合和处理,从而能够在 Web 浏览器中进行详细的逐集群和逐作业交互式分析。此外,以 PDF 文件形式向用户提供性能报告。最后,我们报道了在 MPCDF HPC 系统上大规模部署的实际经验和收益,展示了我们的解决方案如何对任何 HPC 中心都有用。
引用
@article{arxiv.1909.11704,
title = {MPCDF HPC Performance Monitoring System: Enabling Insight via Job-Specific Analysis},
author = {Luka Stanisic and Klaus Reuter},
journal= {arXiv preprint arXiv:1909.11704},
year = {2019}
}
备注
13 pages, 3 figures