TokenPowerBench:用于LLM推理功耗基准测试
机器学习
2025-12-03 v1 人工智能
计算机与社会
分布式、并行与集群计算
摘要
大型语言模型(LLM)服务如今每日需应答数十亿查询,行业报告显示推理而非训练占总体功耗的90%以上。然而,现有基准测试要么聚焦于训练/微调,要么关注推理性能,难以支持功耗测量与分析。我们引入TokenPowerBench——首个专为LLM推理功耗研究设计的轻量且可扩展基准测试框架。该基准测试融合了三要素:(i)声明式配置接口,覆盖模型选择、提示集及推理引擎;(ii)测量层,无需专用功率表即可捕获GPU、节点及系统级能耗;(iii)相位对齐指标管道,为每个请求的预填和解码阶段分配能耗。这些要素使探索LLM推理消耗的能源成为直接可能;此外,通过变更批量大小、上下文长度、并行策略及量化方式,用户可快速评估各设定对每Token能耗及其他能效指标的影响。我们在四类主流模型系列(Llama、Falcon、Qwen、Mistral)上评估了TokenPowerBench。实验覆盖从10亿参数到面向前沿的Llama3-405B模型。我们将TokenPowerBench作为开源项目发布,以帮助用户测量功耗、预测运营成本,并实现LLM服务的可持续发展目标。
引用
@article{arxiv.2512.03024,
title = {TokenPowerBench: Benchmarking the Power Consumption of LLM Inference},
author = {Chenxu Niu and Wei Zhang and Jie Li and Yongjian Zhao and Tongyang Wang and Xi Wang and Yong Chen},
journal= {arXiv preprint arXiv:2512.03024},
year = {2025}
}
备注
Accepted by the AAAI'26 Conference Main Track