从词语到瓦特:基准测试大语言模型推理的能源成本
计算与语言
2023-10-05 v1 分布式、并行与集群计算
摘要
大语言模型(LLMs)因其超越先前最优水平的新生成能力而人气暴涨。这些技术正日益被应用于法律、金融和医学等多个领域。然而,这些模型带来显著的计算挑战,尤其是推理所需的计算与能源成本。推理能源成本所受关注已少于 LLM 训练能源成本——尽管这些大型模型在现实中常被调用来执行推理(例如 ChatGPT)。随着这些最优 LLM 在各领域的使用与部署不断增加,更好地理解其资源利用对于节省成本、扩展性能、高效硬件使用和最优推理策略至关重要。在本文中,我们描述了为研究 LLM 推理的计算与能源利用而开展的实验。我们对不同规模的 LLaMA(Meta AI 开发的近期最优 LLM)在两代主流 GPU(NVIDIA V100 与 A100)和两份数据集(Alpaca 与 GSM8K)上的推理性能与推理能源成本进行了基准测试与初步分析,以反映研究与实践中 LLM 的多样化任务/基准。我们给出了使用模型分片在最多 32 个 GPU 上的多节点、多 GPU 推理结果。据我们所知,我们的工作是首批从如此规模的计算与能源资源视角研究 LLM 推理性能的工作之一。
引用
@article{arxiv.2310.03003,
title = {From Words to Watts: Benchmarking the Energy Costs of Large Language Model Inference},
author = {Siddharth Samsi and Dan Zhao and Joseph McDonald and Baolin Li and Adam Michaleas and Michael Jones and William Bergeron and Jeremy Kepner and Devesh Tiwari and Vijay Gadepally},
journal= {arXiv preprint arXiv:2310.03003},
year = {2023}
}