中文

GPU 多实例功率在分区中的分配问题

分布式、并行与集群计算 2025-05-15 v2 性能

摘要

云数据中心的高效功率管理对于降低成本、提升性能和最小化环境影响至关重要。GPU 是机器学习(ML)和生成 AI(GenAI)等关键任务的主要功耗来源。NVIDIA 的多实例 GPU(MIG)技术通过启用具有每个分区资源跟踪的隔离分区,提高了 GPU 利用率,促进了多个租户之间的 GPU 分享。然而,由于缺乏硬件支持,准确地将 GPU 功耗在 MIG 实例之间划分仍然具有挑战性。本文通过开发软件方法来估计每个 MIG 分区的功耗来解决这一挑战。我们分析了 NVIDIA GPU 利用率指标,发现轻量级方法在准确性方面可能难以实现。因此,我们探索了基于机器学习的功率模型,以实现准确的分区级功率估计。我们的发现表明,单一的通用离线功率模型或建模方法无法适用于多样化的工作负载,尤其是在并发 MIG 使用的情况下,使用基于工作负载在执行期间的分区级利用率指标构建的在线模型可显著提高准确性。我们使用 NVIDIA A100 GPU,展示了这种方法可实现针对包括矩阵乘法和大型语言模型推理等工作负载的准确分区级功率估计,促进了透明且公平的碳排放报告。

关键词

引用

@article{arxiv.2501.17752,
  title  = {On the Partitioning of GPU Power among Multi-Instances},
  author = {Tirth Vamja and Kaustabha Ray and Felix George and UmaMaheswari C Devi},
  journal= {arXiv preprint arXiv:2501.17752},
  year   = {2025}
}