SweetSpot:用于预测LLM推理能源效率的分析模型
人工智能
2026-04-24 v2 性能
摘要
大语言模型 (LLMs)推理是现代人工智能应用的核心,主导了全球数据中心的工作负载,因此预测其能源足迹至关重要。现有的做法将能源消耗估计为输入和输出序列的简单线性函数。然而,通过分析Transformer的自回归结构,这一结构暗示了输入和输出序列长度与能源消耗之间存在根本上的非线性关系,我们展示了存在一种生成能源最低点。峰值效率在短至中等长度的输入和中等长度的输出时发生,而对于长输入或非常短的输出,效率会急剧下降。Consequently,我们提出SweetSpot,一个源自Transformer架构的计算和内存访问复杂度推导的分析模型,准确地将其能源效率曲线表述为输入和输出长度的函数。为评估准确性,我们使用TensorRT-LLM在NVIDIA H100 GPU上测量能源消耗,测试的LLMs规模从1B到9B参数,包括OPT、LLaMA、Gemma、Falcon、Qwen2和Granite。我们测试的输入和输出长度范围为64到4096个标记,实现了均值为1.79%的平均绝对百分误差(MAPE)。我们的结果表明,将序列长度与这些效率"甜点"对齐可减少能源使用,最高可达33.41倍,使生产系统能够获得明智的截断、摘要和自适应生成策略。
关键词
引用
@article{arxiv.2602.05695,
title = {SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference},
author = {Hiari Pizzini Cavagna and Andrea Proia and Giacomo Madella and Giovanni B. Esposito and Francesco Antici and Daniele Cesarini and Zeynep Kiziltan and Andrea Bartolini},
journal= {arXiv preprint arXiv:2602.05695},
year = {2026}
}
备注
To appear at ICPE 2026 (International Conference on Performance Engineering)