中文

混合异构集群可降低大语言模型推理工作负载的能源消耗

分布式、并行与集群计算 2024-07-02 v1 人工智能

摘要

训练和使用大型语言模型(LLM)都需要大量能源。由于其日益增长的流行,对托管这些模型的数据中心的能源效率和可持续性提出了关键性关切。本文针对数据中心运行大型语言模型时的能源消耗问题提出了解决方案。我们提出一种混合数据中心模型,采用基于成本的调度框架,动态地在能源效率和计算能力各异的硬件加速器之间分配LLM任务。具体而言,基于工作负载的策略会根据查询中输入和输出标记的数量,决定任务是在处理能效较好的处理器上运行,还是在高性能GPU上运行。对代表性LLM数据集的分析发现,与工作负载不敏感的基线相比,这种混合策略可将CPU+GPU能源消耗降低7.5%。

关键词

引用

@article{arxiv.2407.00010,
  title  = {Hybrid Heterogeneous Clusters Can Lower the Energy Consumption of LLM Inference Workloads},
  author = {Grant Wilkins and Srinivasan Keshav and Richard Mortier},
  journal= {arXiv preprint arXiv:2407.00010},
  year   = {2024}
}