基于 PIE-P 的并行化 LLM 推理细粒度能耗预测
分布式、并行与集群计算
2025-12-16 v1 性能
摘要
随着大语言模型(LLM)的广泛采用,运行 LLM 的能耗成本正迅速成为关键问题。然而,精确测量 LLM 的能耗往往不可行,因为硬件功耗监视器并非始终可访问,且基于软件的能耗测量工具不够准确。虽然已开发出多种预测技术来估计 LLM 能耗,但这些方法仅限于单 GPU 环境,因此不适用于通常在多 GPU 上并行化的现代 LLM 推理。在本工作中,我们弥补了这一空白,提出了 PIE-P,一个面向多 GPU 推理的细粒度能耗预测框架,涵盖张量并行、流水线并行和数据并行。由于 GPU 间通信的非确定性、额外的通信开销以及通信/同步阶段能耗隔离的困难,并行化推理下的能耗预测变得复杂。我们开发了一个可扩展的预测框架,通过精确采样、对 GPU 间通信的细粒度建模以及谨慎计算并行化开销来解决这些问题。我们的评估结果表明,PIE-P 在各种并行策略下产生了准确且细粒度的能耗预测,显著优于基线方法。
引用
@article{arxiv.2512.12801,
title = {Fine-Grained Energy Prediction For Parallellized LLM Inference With PIE-P},
author = {Anurag Dutt and Young Won Choi and Avirup Sil and Anshul Gandhi and Aruna Balasubramanian and Niranjan Balasubramanian},
journal= {arXiv preprint arXiv:2512.12801},
year = {2025}
}