中文

迈向更绿色的LLM:将能效置于LLM推理的核心

人工智能 2024-04-01 v1 硬件体系结构 分布式、并行与集群计算

摘要

随着现代大型语言模型(LLM)在各行各业的普遍使用,这些模型的推理服务正在不断扩展。鉴于现代LLM的高计算和内存需求,越来越多的顶级GPU被部署来服务这些模型。能源可用性已成为扩展数据中心以服务这些模型的最大挑战。在本文中,我们展示了在性能SLO下将能效作为LLM服务主要目标所带来的权衡。我们表明,根据输入、模型和服务水平协议,LLM推理提供商可以使用多个调节手段来实现能效。我们刻画了这些调节手段对延迟、吞吐量以及能耗的影响。通过探索这些权衡,我们为在不影响性能的情况下优化能源使用提供了宝贵的见解,从而为在数据中心环境中实现可持续且具有成本效益的LLM部署铺平了道路。

关键词

引用

@article{arxiv.2403.20306,
  title  = {Towards Greener LLMs: Bringing Energy-Efficiency to the Forefront of LLM Inference},
  author = {Jovan Stojkovic and Esha Choukse and Chaojie Zhang and Inigo Goiri and Josep Torrellas},
  journal= {arXiv preprint arXiv:2403.20306},
  year   = {2024}
}

备注

6 pages, 15 figures