EnergyLens:面向多 GPU LLM 推理优化的预测性能耗感知探索
机器学习
2026-05-15 v1
摘要
我们提出了 EnergyLens,一个用于能耗感知大语言模型 (LLM) 推理优化的端到端框架。随着 LLM 规模的扩大,预测和减少其能耗足迹对于可持续性和数据中心运营变得至关重要,然而现有方法要么需要生产级代码和昂贵的性能分析,要么无法准确捕捉多 GPU 能耗行为。因此,当详尽的性能分析不可行时,从业者缺乏工具来决定应优先考虑哪些优化,并在现有部署配置中进行选择。EnergyLens 通过一个直观的基于 einsum 的接口填补了这一空白,该接口捕捉包括融合、并行和计算-通信重叠在内的 LLM 规格,结合了负载不平衡感知的 MoE 建模以及面向多 GPU 设置的实证驱动通信能耗模型。我们在张量并行和专家并行配置下对 Llama3 和 Qwen3-MoE 验证了 EnergyLens,多 GPU 预填充和解码能耗的平均绝对百分比误差 (MAPE) 在 9.25% 到 13.19% 之间,而 Megatron 风格重叠的 SM 分配误差为 12.97%。我们的能耗驱动探索揭示了预填充和解码效率中各配置间分别高达 1.47 倍和 52.9 倍的能耗差异,并推动了分布式服务部署。我们进一步表明,仅凭直觉难以优化计算-通信重叠,但 EnergyLens 能够正确识别帕累托最优重叠配置。
引用
@article{arxiv.2605.14249,
title = {EnergyLens: Predictive Energy-Aware Exploration for Multi-GPU LLM Inference Optimization},
author = {Zhiye Song and Kyungmi Lee and Eun Kyung Lee and Xin Zhang and Tamar Eilam and Anantha P. Chandrakasan},
journal= {arXiv preprint arXiv:2605.14249},
year = {2026}
}