中文

Watt Counts:面向异构 GPU 架构的能源感知 LLM 推理基准

分布式、并行与集群计算 2026-04-13 v1 人工智能

摘要

尽管大语言模型(LLM)的高能耗已被社区广泛认知,但系统运营者因缺乏能源感知基准和数据而难以部署能够利用异构硬件能源权衡的能源高效 LLM 推理方案。为此,我们提出Watt Counts:最大规模开放访问 LLM 能耗数据集,包含 5000 多次实验,覆盖 50 个 LLM 及 10 块 NVIDIA 图形处理单元(GPU),涵盖批处理和服务器场景,并附带可复现、开源的基准框架,支持社区提交扩充数据集。基于该数据集,我们对 LLM 推理在异构 GPU 架构上的系统层面进行研究,表明 GPU 选择对能源效率结果至关重要,且最优硬件选择在不同模型和部署场景下差异显著,凸显了在异构 LLM 系统中进行硬件感知部署的关键性。结合我们的数据和洞察,我们展示在服务器场景下可将能源消耗降低最高 70%,在批处理场景下可降低最高 20%,且对用户体验影响可忽略不计。

关键词

引用

@article{arxiv.2604.09048,
  title  = {Watt Counts: Energy-Aware Benchmark for Sustainable LLM Inference on Heterogeneous GPU Architectures},
  author = {Mauricio Fadel Argerich and Jonathan Fürst and Marta Patiño-Martínez},
  journal= {arXiv preprint arXiv:2604.09048},
  year   = {2026}
}

备注

Under review