CEEMS:一种面向资源管理器的能耗与排放监测栈
系统与控制
2024-12-11 v1 系统与控制
摘要
随着过去几年机器学习/人工智能研究的快速发展,信息与通信技术(ICT)领域的能耗迅速增长。由于这些能耗的大部分来自用户的工作负载,用户有必要了解其应用程序的能耗足迹。计算能耗与排放监测栈(CEEMS)旨在解决这一问题。CEEMS 能够实时报告 HPC 和云平台 alike 的用户工作负载的能耗与等效排放。除了 CPU 能耗使用外,它还支持报告 NVIDIA 和 AMD GPU 加速器上工作负载的能耗使用。CEEMS 围绕可观测性生态系统中的知名开源工具(如 Prometheus 和 Grafana)构建。CEEMS 被设计为可扩展的,允许数据中心(DC)运维人员基于底层硬件轻松定义用户工作负载的能耗估算规则。本文阐述了 CEEMS 的架构概览、用于测量能耗使用和估算等效排放的数据源,以及来自运维人员和用户视角的 CEEMS 潜在用例。最后,本文将描述 CEEMS 在 Jean-Zay 超级计算平台上的部署,该部署能够监控超过 1400 个节点,日均作业切换率约为 2 万个作业。
引用
@article{arxiv.2412.07290,
title = {CEEMS: A Resource Manager Agnostic Energy and Emissions Monitoring Stack},
author = {Mahendra Paipuri},
journal= {arXiv preprint arXiv:2412.07290},
year = {2024}
}