中文

AI训练功率需求的实证测量:基于GPU加速节点的能源分析

硬件体系结构 2025-03-25 v2

摘要

人工智能(AI)应用的扩张推动了计算基础设施的大规模投资,尤其是由云计算提供商主导。量化该基础设施的能源足迹需要建立以AI硬件训练期间功率需求为参数的模型。我们对8颗NVIDIA H100 HGX GPU节点的瞬时功耗进行实证测量,分别针对开源图像分类模型(ResNet)和大型语言模型(Llama2-13b)进行训练。我们观察到的最大功率为约8.4千瓦,较制造商标称的10.2千瓦低出18%,即便在GPU接近满负载的情况下。保持模型架构不变,增加ResNet的批量大小从512增至4096图像,可将总训练能耗降低约4倍。这些发现可为数据中心运营商的容量规划以及研究人员的能耗估算提供参考。未来工作将探讨冷却技术和碳感知调度对AI工作负载能耗的影响。

关键词

引用

@article{arxiv.2412.08602,
  title  = {Empirical Measurements of AI Training Power Demand on a GPU-Accelerated Node},
  author = {Imran Latif and Alex C. Newkirk and Matthew R. Carbone and Arslan Munir and Yuewei Lin and Jonathan Koomey and Xi Yu and Zhiuha Dong},
  journal= {arXiv preprint arXiv:2412.08602},
  year   = {2025}
}