迈向更绿色的LLM:将能效置于LLM推理的核心
人工智能
2024-04-01 v1 硬件体系结构
分布式、并行与集群计算
摘要
随着现代大型语言模型(LLM)在各行各业的普遍使用,这些模型的推理服务正在不断扩展。鉴于现代LLM的高计算和内存需求,越来越多的顶级GPU被部署来服务这些模型。能源可用性已成为扩展数据中心以服务这些模型的最大挑战。在本文中,我们展示了在性能SLO下将能效作为LLM服务主要目标所带来的权衡。我们表明,根据输入、模型和服务水平协议,LLM推理提供商可以使用多个调节手段来实现能效。我们刻画了这些调节手段对延迟、吞吐量以及能耗的影响。通过探索这些权衡,我们为在不影响性能的情况下优化能源使用提供了宝贵的见解,从而为在数据中心环境中实现可持续且具有成本效益的LLM部署铺平了道路。
引用
@article{arxiv.2403.20306,
title = {Towards Greener LLMs: Bringing Energy-Efficiency to the Forefront of LLM Inference},
author = {Jovan Stojkovic and Esha Choukse and Chaojie Zhang and Inigo Goiri and Josep Torrellas},
journal= {arXiv preprint arXiv:2403.20306},
year = {2024}
}
备注
6 pages, 15 figures