中文

LLM 解码中的功率阈值幻觉:基于注意力架构的相位感知能源特征

分布式、并行与集群计算 2026-05-13 v1 人工智能 机器学习 性能

摘要

功率阈值是 LLM 推理服务中的标准 GPU 能源调节手段,似乎有效:吞吐量下降,功率读数下降,能源预算得以满足。我们指出,这种表面现象在主导生产环境推理的解码阶段并不真实。在四种注意力范式(GQA、MLA、Gated DeltaNet 和 Mamba2)上使用 NVIDIA H200,解码阶段仅耗能 137--300 W,远低于 700 W 的 GPU 额定功率,因而无需触发功率阈值;这是因为内存受限的解码已饱和 HBM 带宽,而非计算资源,未触及功率余量。固件发起的时钟降频进一步加剧了这种幻觉:这些偏差可能干扰将其归因于阈值的吞吐量测量。通过锁定时钟,可消除上述两种混淆因素,在针对实际关键路径上的调节手段时,时钟锁定在能源和吞吐量之间实现帕累托最优,最高可恢复解码能源的 32%,同时对吞吐量影响最小。我们识别出三种架构相关的 DVFS 行为类别,并对新型注意力替代方案的统一能源模式进行了特征化:较高的预填充成本被高效解码所收回,最终在生产批处理规模下相较于 GQA 可将总请求能耗减半。

关键词

引用

@article{arxiv.2605.11999,
  title  = {The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures},
  author = {Bole Ma and Ayesha Afzal and Jan Eitzinger and Gerhard Wellein},
  journal= {arXiv preprint arXiv:2605.11999},
  year   = {2026}
}