MaaSO:面向MaaS的SLO感知异构模型实例编排
分布式、并行与集群计算
2025-09-09 v1
摘要
模型即服务(MaaS)平台面临来自各种大型语言模型(LLM)应用的多样化服务水平目标(SLO)要求,表现为上下文复杂度、首字延迟和字间延迟。另一方面,一个 LLM 实例在不同的并行策略和推理批处理大小配置下,具有不同的性能特征,从而可用于满足不同的 SLO 要求。然而,当前的 LLM 推理系统通常以相同的配置部署相同的模型实例,缺乏利用这种异构性的机制。为填补这一研究空白,我们提出MaaSO——首个MaaS编排器,其包含三个模块:(1)在不同并行策略和推理批处理大小下对实例性能进行特征化的分析器;(2)优化异构实例配置的放置器;(3)启用SLO感知请求分配并防止连续批处理中的级联超时的分配器。实验表明,MaaSO相比于现有方法提高了SLO满足率提高了15%至30%,显著降低了响应延迟降低了40%至60%,并显著降低了总体编排开销。
引用
@article{arxiv.2509.06362,
title = {MaaSO: SLO-aware Orchestration of Heterogeneous Model Instances for MaaS},
author = {Mo Xuan and Zhang yue and Wu Weigang},
journal= {arXiv preprint arXiv:2509.06362},
year = {2025}
}