在功率限制下的现代 GPU 硬件资源分区与作业分配优化
分布式、并行与集群计算
2024-05-08 v1
摘要
CPU-GPU 异构系统如今已在 HPC(高性能计算)中被广泛使用。然而,提高此类系统的利用率和能源效率仍是最关键的问题之一。由于单个程序通常无法完全利用节点/芯片内的所有资源,协调(或共占)多个具有互补资源需求的程序是一个有前景的解决方案。同时,由于功耗已成为 HPC 系统的首要设计约束,这种协调技术应针对受限功耗的环境进行优化。为了此目的,行业最近开始在现代 GPU 上支持硬件级资源分区功能,以实现高效协调,这些功能可与现有的功率限制功能配合工作。例如,NVidia 的 MIG(Multi-Instance GPU)将单个 GPU 分区为多个实例,粒度为 GPC(图形处理集群)。本文明确针对硬件级 GPU 分区功能与功率限制的组合,用于受限功耗的 HPC 系统。我们提供了一种系统方法,以我们的可扩展性/干扰建模为基础,优化芯片分区、作业分配以及功率限制的组合,同时考虑了诸多方面,如计算/内存密集度和异构计算资源(如 Tensor 核心)的利用率。实验结果表明,我们的方法在选择不同工作负载的近最优组合方面是成功的。
引用
@article{arxiv.2405.03838,
title = {Optimizing Hardware Resource Partitioning and Job Allocations on Modern GPUs under Power Caps},
author = {Eishi Arima and Minjoon Kang and Issa Saba and Josef Weidendorfer and Carsten Trinitis and Martin Schulz},
journal= {arXiv preprint arXiv:2405.03838},
year = {2024}
}