PALS:面向混合专家模型的功耗感知LLM服务
人工智能
2026-05-21 v1 分布式、并行与集群计算
摘要
大语言模型(LLM)推理已成为现代数据中心的主导工作负载,推动了显著的GPU利用率和能源消耗。虽然先前的系统通过批处理、调度和并行化优化吞吐量和延迟,但大致将GPU功耗视为静态约束而非可控资源。本文提出了一种面向LLM服务的功耗感知运行时PALS,将GPU功耗上限置于首要控制旋钮,并与软件参数(如 batch size)联合优化。该系统结合轻量级离线功耗-性能模型与反馈驱动的控制器,选择能够满足吞吐量目标的同时最大化能源效率的配置。我们在现有的LLM服务框架vLLM中实现了PALS,无需模型再训练或API变更。在多GPU系统和稠密模型以及混合专家(MoE)模型上,PALS在能源效率方面提升了最高可达26.3%,在功耗约束下的QoS违规减少了4倍至7倍,并能跟踪动态功率预算。这些结果凸显了将功率控制直接集成到LLM推理运行时的潜力,使能源比例式和网格交互式AI系统成为可能。
引用
@article{arxiv.2605.21427,
title = {PALS: Power-Aware LLM Serving for Mixture-of-Experts Models},
author = {Can Hankendi and Rana Shahout and Minlan Yu and Ayse K. Coskun},
journal= {arXiv preprint arXiv:2605.21427},
year = {2026}
}
备注
13 pages, 10 figures