中文

POLCA:LLM 云提供商中的功率超额订阅

分布式、并行与集群计算 2023-08-25 v1 硬件体系结构 机器学习

摘要

大语言模型(LLMs)近期的创新及其众多用例迅速推高了数据中心 GPU 的计算容量需求。若干云提供商和其他企业已制定 substantial 的数据中心扩张计划以支持这些新工作负载。数据中心的关键瓶颈资源之一是功率,并且鉴于 LLM 日益增大的模型规模,它们正变得愈发耗电。在本文中,我们展示了在 LLM 集群中超额订阅功率的巨大机会。功率超额订阅提升了这些数据中心的功率效率,允许每个数据中心部署更多服务器,并缩短了部署时间,因为建设新数据中心十分缓慢。我们广泛刻画了多种 LLM 及其配置的功耗模式。我们识别了推理与训练功耗模式之间的差异。基于对这些 LLM 的分析,我们断言 LLM 集群中用于推理的平均和峰值功率利用率不应很高。我们的推论与来自生产 LLM 集群的数据一致,揭示推理工作负载为功率超额订阅提供了可观的余量。然而,GPU 在虚拟化环境中提供的严格遥测与控制集合,使得构建可靠且稳健的功率超额订阅机制具有挑战性。我们提出 POLCA,我们的功率超额订阅框架,其对 GPU 集群稳健、可靠且易于部署。利用开源模型复现生产中观测到的功率模式,我们模拟了 POLCA 并证明可在同一 GPU 集群中多部署 30% 的服务器用于推理,且性能损失极小。

关键词

引用

@article{arxiv.2308.12908,
  title  = {POLCA: Power Oversubscription in LLM Cloud Providers},
  author = {Pratyush Patel and Esha Choukse and Chaojie Zhang and Íñigo Goiri and Brijesh Warrier and Nithish Mahalingam and Ricardo Bianchini},
  journal= {arXiv preprint arXiv:2308.12908},
  year   = {2023}
}