中文

从服务器到站点:LLM 推理的组合式功率轨迹生成,用于基础设施规划

分布式、并行与集群计算 2026-03-20 v1

摘要

数据中心运营商和电力公司依赖于不同尺度上的功率轨迹。运营商使用细粒度轨迹进行配给、设施管理和调度,而电力公司使用站点级负荷概要文件进行容量和互联规划。现有的数据中心功率模型未能捕捉 LLM 推理工作负载,其中 GPU 在计算密集型 prefill、低功耗 decode 和空闲状态之间快速切换,设施需求取决于这些状态如何在众多设备上演化和同步。我们表明,LLM 推理功率可以通过两种组成部分进行组合表示:由工作负载驱动的 operating state 之间的转换以及这些状态中特定配置的功率分布。基于此观察,我们开发了一个从测量轨迹中学习并合成新流量条件和服务配置的功率概要文件生成框架。这些轨迹从 GPU 服务器聚合到机架、行和设施规模的负荷概要文件,具有研究所需的时序粒度。跨多个 LLM、tensor-parallel 设置和 GPU 代数,我们的框架在大多数配置下实现能量误差低于 5%,同时保持时序自相关结构。所得轨迹支持包括超配、功率调制和面向电力公司的负荷特征化等下游分析,使基础设施评估能够支持平坦的 nameplate 假设和静态轨迹重放无法支持的评估。

关键词

引用

@article{arxiv.2603.18383,
  title  = {From Servers to Sites: Compositional Power Trace Generation of LLM Inference for Infrastructure Planning},
  author = {Grant Wilkins and Fiodar Kazhamiaka and Ram Rajagopal},
  journal= {arXiv preprint arXiv:2603.18383},
  year   = {2026}
}