面向大规模组合优化的 LLMServingSim 2.0:异构与非一致 LLM 服务基础设施的统一仿真器
分布式、并行与集群计算
2026-03-24 v2 人工智能
摘要
大型语言模型 (LLM) 服务基础设施正向异构性和非一致性转变。现代部署日益集成多样化加速器和近内存处理技术,带来显著的硬件异构性,而系统软件也日益将计算、内存和模型组件在分布式资源中分离,以提升可扩展性和效率。因此,LLM 服务性能不再仅由硬件或软件选择决定,而是由其通过调度、数据传输和互联行为的运行时交互所主导。然而,理解这些交互仍具有挑战性,因为现有仿真器缺乏在统一、以运行时为导向的框架中联合建模异构硬件和非一致服务技术的能力。本文提出 LLMServingSim 2.0,一种统一的系统级仿真器,旨在使 LLM 服务基础设施中运行时驱动的硬件-软件交互变得显式且可分析。LLMServingSim 2.0 将服务决策与硬件行为嵌入单一运行时循环,实现对批处理、路由、卸载、内存和功耗的交互感知建模。仿真器支持通过轮廓建模实现对新兴加速器和存储系统的可扩展集成,同时捕捉动态服务行为和系统级效应。我们对 LLMServingSim 2.0 进行了与真实部署的验证,结果表明其在复制关键性能、内存和功耗指标方面表现出色,平均误差为 0.95%,而仿真时间约为 10 分钟,即使面对复杂配置亦如此。这些结果表明,LLMServingSim 2.0 为硬件创新与服务系统设计之间提供了实用的桥梁,使我们能够系统地探索和协同设计面向下一代 LLM 服务基础设施的方案。
引用
@article{arxiv.2602.23036,
title = {LLMServingSim 2.0: A Unified Simulator for Heterogeneous and Disaggregated LLM Serving Infrastructure},
author = {Jaehong Cho and Hyunmin Choi and Guseul Heo and Jongse Park},
journal= {arXiv preprint arXiv:2602.23036},
year = {2026}
}
备注
14 pages, 11 figures