中文

超越测试时计算策略:主张LLM推理中的能耗-词元

计算与语言 2026-03-24 v1

摘要

大型语言模型( LLMs)在各种任务上表现卓越,但伴随着巨大的能耗和计算成本,尤其是在请求密集型场景中。许多实际应用中,LLM的完整规模和能力往往并不必要,因而小型语言模型( SLMs)可以为更简单的文本生成任务提供准确响应。当采用链式思维(CoT)提示或多数投票等先进推理策略增强后,SLMs可以接近大型模型的性能,同时降低总体计算需求。然而,这些策略也可能引入额外的能耗成本,造成能耗-准确性权衡。我们的分析检验了这些在较小模型与较大模型之间进行的测试时计算策略之间的权衡,使用MMLU基准。此外,我们探讨了变换器架构的输入输出词元动态,导致LLM呈非线性硬件能耗运行曲线。为弥合AI研究与其物理影响之间的鸿沟,我们提出能耗效率指标,包括能耗-词元(Energy-per-Token),作为传统准确性基准的补充。除模型选择外,我们提出在CoT词元生成中采用受控推理,通过运行曲线动态调节推理深度。本研究愿景将能源感知路由机制与模型选择和推理策略相结合,确保在可持续AI部署中平衡准确性。

关键词

引用

@article{arxiv.2603.20224,
  title  = {Beyond Test-Time Compute Strategies: Advocating Energy-per-Token in LLM Inference},
  author = {Patrick Wilhelm and Thorsten Wittkopp and Odej Kao},
  journal= {arXiv preprint arXiv:2603.20224},
  year   = {2026}
}