制冷很重要:在液体冷却与空气冷却 H100 GPU 系统上对大型语言模型和视觉语言模型进行基准测试
分布式、并行与集群计算
2025-07-23 v1
摘要
人工智能(AI)工作负载的快速增长,最近由大型语言模型(LLM)和视觉语言模型(VLM)主导,加剧了数据中心的功耗和散热需求。本研究在两个 HGX 节点上进行基准测试,每个节点配有8个NVIDIA H100 图形处理单元(GPU),分别采用液体冷却和空气冷却。利用 GPU Burn、Weights and Biases 和 IPMItool,我们收集了详细的热、功耗和计算数据。结果表明,在负载下,液体冷却系统维持GPU温度在41-50度之间,而空气冷却系统则在54-72度之间波动。这种热稳定性使液体冷却系统实现了17%更高的性能(每个GPU为54 TFLOPS vs. 46 TFLOPS),提升了性能/功率比,减少能源开销,并提高了系统效率。这些发现凸显了液体冷却的能源和可持续性优势,为超大规模数据中心提供了一条可行之路。
引用
@article{arxiv.2507.16781,
title = {Cooling Matters: Benchmarking Large Language Models and Vision-Language Models on Liquid-Cooled Versus Air-Cooled H100 GPU Systems},
author = {Imran Latif and Muhammad Ali Shafique and Hayat Ullah and Alex C. Newkirk and Xi Yu and Arslan Munir},
journal= {arXiv preprint arXiv:2507.16781},
year = {2025}
}
备注
11 pages