中文

立场:大语言模型推理应作为能量到令牌的生产过程来评估

计算工程、金融与科学 2026-05-13 v1 分布式、并行与集群计算

摘要

大语言模型推理目前仍主要作为模型或软件问题来评估:关注准确率、延迟、吞吐量和硬件利用率。这是不完整的。在部署规模上,相关的产出是在有效计算、交付的数据中心功率、冷却能力、电能利用效率(PUE)和利用率的联合约束下,产生的质量条件令牌。我们认为,机器学习社区应将推理视为“能量到令牌的生产”。我们用一个量纲一致的令牌生产函数来形式化这一观点,其中令牌速率受限于每令牌计算量和每令牌能耗的上限。不同供应商的公开API价格相差一个数量级以上,但我们仅将价格分散性作为方向性动机,而非边际成本的因果证据。核心的物理问题在于:在固定的质量和服务目标下,约束何时从理论峰值计算转向交付功率、冷却和运营效率?在此框架下,系统优化——如潜在KV缓存压缩、稀疏或高度压缩的注意力机制、量化、路由和难度自适应推理——不仅仅是局部的工程技巧。它们是能量到令牌的杠杆,因为它们在固定的(q,s)(q^{*},s^{*})下减少了每令牌浮点运算次数、每令牌焦耳数、内存流量或利用率损失。因此,我们呼吁推理论文和基准测试在报告精度和速度的同时,也报告每令牌焦耳数、当前起作用的约束、经PUE调整的交付功率以及经利用率调整的令牌产出。

关键词

引用

@article{arxiv.2605.11733,
  title  = {Position: LLM Inference Should Be Evaluated as Energy-to-Token Production},
  author = {Xiang Liu and Shimiao Yuan and Zhenheng Tang and Peijie Dong and Kaiyong Zhao and Qiang Wang and Bo Li and Xiaowen Chu},
  journal= {arXiv preprint arXiv:2605.11733},
  year   = {2026}
}

备注

https://dominic789654.github.io/energy-to-token/