中文

模型停靠税:衡量始终在线 GPU 模型部署的隐藏能源成本

分布式、并行与集群计算 2026-05-26 v1 机器学习 性能

摘要

AI 推理行业将模型一直加载在 GPU 内存中以避免冷启动延迟,隐式地将空闲功耗视为就绪成本的固定支出。然而,这一成本结构从未被经验性地分解——且从未跨 GPU 架构进行评估。我们对空闲 GPU 功耗进行首次跨架构测量,将其作为 VRAM 分配的函数,结合 18 天的生产遥测(335,267 个样本,14 台 H100 GPU)以及在三个 GPU 架构上进行受控剂量-反应实验,涵盖三个内存技术:NVIDIA H100(HBM3,80 GB)、A100(HBM2e,80 GB)和 L40S(GDDR6,48 GB)。我们观察到所有三个架构上的空闲功耗呈分段常数:CUDA 上下文强制进行离散 DVFS 转换,耗能增加 26-66 W 超过裸空闲(HBM 架构 26-50 W,GDDR6 为 66 W),而边际 VRAM 效果在所有测试设备上均受测量相关性限制以下(|β| < 0.02 W/GB)。CUDA 上下文占停靠税的 >98%。我们用实际的 HuggingFace 模型(Qwen2.5-7B)在所有三个架构上进行验证,确认在每个设备上均与空张量相差 <0.5 W,并捕获模型加载期间的冷启动功耗轮廓。我们推导冷启动盈亏平衡模型,指出能源最优行为取决于请求到达率和加载延迟——而非模型规模——盈亏平衡区间为 1-5 分钟。我们的结果识别出一个跨所有测试架构都适用的约束条件:空闲-带上下文功耗由 DVFS 状态决定,而非内存占用。

关键词

引用

@article{arxiv.2605.23918,
  title  = {The Model Parking Tax: Quantifying the Hidden Energy Cost of Always-On GPU Model Deployment},
  author = {Sai Sathvik Vadari},
  journal= {arXiv preprint arXiv:2605.23918},
  year   = {2026}
}

备注

7 pages, 3 figures, 5 tables