AI推理的能耗:效率路径与测试时计算
机器学习
2026-05-18 v1 分布式、并行与集群计算
摘要
随着AI推理扩展至数十亿次查询,且新兴的推理和智能体工作流不断增加token需求,对每次查询能耗的可靠估计对于容量规划、排放核算和效率优先级排序变得越来越重要。许多公开估计存在不一致且高估能耗的问题,因为它们从有限的基准中外推,且未能反映规模化可实现的效率提升。在此,我们提出了一种基于token吞吐量的自底向上方法,用于估计大规模LLM系统的每次查询能耗。对于在H100节点上以实际工作负载运行、GPU利用率和PUE约束下的前沿规模模型(>200B参数),我们估计每次查询的中位能耗为0.34 Wh(IQR: 0.18–0.67)。这些结果与生产规模配置的测量结果一致,表明非生产环境的估计和假设可能高估能耗4–20倍。扩展到每次典型查询增加15倍token的测试时扩展场景,中位能耗上升13倍至4.32 Wh,表明针对该场景瞄准效率将带来最大规模的舰队级节能。我们量化了模型、服务平台和硬件层面的可实现效率提升,发现单次中位能耗可降低1.5–3.5倍,而联合进步有望实现8–20倍的降低。为说明系统级影响,我们估计一个服务10亿次查询的部署的基线日能耗为0.8 GWh/天。若其中10%为长查询,需求可能增长至1.8 GWh/天。通过有针对性的效率干预,可降至0.9 GWh/天,与同等规模下网页搜索的能耗足迹相似。这呼应了数据中心在互联网和云计算建设期间如何通过效率提升来遏制能耗增长的历史。
引用
@article{arxiv.2509.20241,
title = {Energy Use of AI Inference: Efficiency Pathways and Test-Time Compute},
author = {Felipe Oviedo and Fiodar Kazhamiaka and Esha Choukse and Allen Kim and Amy Luers and Melanie Nakagawa and Ricardo Bianchini and Juan M. Lavista Ferres},
journal= {arXiv preprint arXiv:2509.20241},
year = {2026}
}
备注
A preprint version with DOI is available at Zenodo: https://doi.org/10.5281/zenodo.17188770