基于 AMD GPU/APU 的 exascale 节点的细粒度功耗与能耗归因
分布式、并行与集群计算
2026-04-13 v2 硬件体系结构
摘要
现代 exascale GPU 和 APU 系统提供多个功耗和能耗传感器,但作用范围、更新率、时序和滤波的差异使得短时加速器活动的归因变得复杂。本文提出了一种方法,用于表征和纠正 Cray EX 系统中 AMD Instinct MI250X GPU(Frontier)和 MI300A APU(Portage)上的这些效应。通过受控方波工作负载,我们量化了多达 512 个 GPU 和 480 个 APU 上的更新间隔、延迟、混叠和变异性,涵盖芯片内(rocm-smi/amd-smi)和芯片外 Cray 功耗管理传感器。我们从累积能耗计数器重建功耗以实现更快的响应时间,将其与芯片内、芯片外和节点级传感器进行验证,并将生成的流集成到基于 Score-P/PAPI 的工具中,实现时间对齐、阶段级归因。应用于 rocHPL、rocHPL-MxP 和 HPG-MxP,该方法分离了因运行时间减少带来的能耗节省与功率变化。混合精度在 Frontier 上将节点能耗降低了 rocHPL-MxP 的 79% 和 HPG-MxP 的 31%,Portage 上也有类似趋势。这些结果为当前和未来 exascale 系统上的传感器验证和功耗感知优化提供了可移植的指导。
引用
@article{arxiv.2604.06056,
title = {Fine-Grained Power and Energy Attribution on AMD GPU/APU-Based Exascale Nodes},
author = {Adam McDaniel and Michael Jantz and Ashesh Sharma and Steve Abbott and Steven Martin and Shreyas Khandekar and Brandon Neth and Bruno Villasenor Alvarez and Aditya Kashi and Wael Elwasif and Oscar Hernandez},
journal= {arXiv preprint arXiv:2604.06056},
year = {2026}
}