驯服混沌:面向异构和非均匀 LLM 推理的协调自动扩缩框架
分布式、并行与集群计算
2025-08-28 v1 人工智能
摘要
为大型语言模型(LLM)提供服务是一项 GPU 密集型任务,其中传统的自动扩缩器在处理现代 Prefill-Decode(P/D)非均匀架构时表现不足。这种架构的转变虽强大,但带来了显著的运营挑战,包括对异构硬件资源的低效利用、网络瓶颈以及 prefill 和 decode 阶段之间的关键不平衡。我们引入 HeteroScale,一个协调式自动扩缩框架,以解决 P/D 非均匀服务的核心挑战。HeteroScale 结合了能够适应异构硬件和网络约束的拓扑感知调度器,以及源自首个大规模生产环境中自动扩缩信号实证研究的 novel metric驱动策略。通过利用单一稳健的指标联合扩缩 prefill 和 decode 池,HeteroScale 在保持架构平衡的同时,确保了高效、自适应的资源管理。该系统已在拥有数万块 GPU 的大型生产环境中部署,证明了其有效性,平均 GPU 利用率提高了显著的 26.6 个百分点,每天为数百万 GPU 小时节省了大量成本,同时仍满足严格的服务等级目标。
引用
@article{arxiv.2508.19559,
title = {Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference},
author = {Rongzhi Li and Ruogu Du and Zefang Chu and Sida Zhao and Chunlei Han and Zuocheng Shi and Yiwen Shao and Huanle Han and Long Huang and Zherui Liu and Shufan Liu},
journal= {arXiv preprint arXiv:2508.19559},
year = {2025}
}