面向在线-离线协同部署的 LLM 服务的 OOCO:延迟异构架构
分布式、并行与集群计算
2025-12-01 v1
摘要
大型语言模型(LLM)日益被部署在延迟敏感的在线服务以及成本敏感的离线工作负载中。将这些工作负载共置于共享的服务实例上可提高资源利用率,但直接将其应用于 Prefill/Decode(P/D)异构系统会引入严重的负载不平衡,因为请求组合的波动会改变固有的 P/D 比例。现有的动态调整技术无法跟上在线服务的突发性流量模式。我们提出了一种受延迟约束的异构架构,将集群资源划分为延迟严格池和延迟宽松池,基于任务延迟要求进行灵活布局。这一设计使离线解码任务能够灵活放置,从而缓解 P/D 不平衡,同时保持在线性能。为充分利用这种灵活性,我们提出了(1)基于 Roofline 性能模型引导的瓶颈级调度器,用于基于性能瓶颈的调度;以及(2)严格遵守服务水平目标(SLO)的快速抢占机制。实验在真实跟踪数据上表明,与现有的离线系统方法相比,我们的方法在离线吞吐量提升至多 3 倍,同时保持在线请求的 SLO。
引用
@article{arxiv.2511.21862,
title = {OOCO: Latency-disaggregated Architecture for Online-Offline Co-locate LLM Serving},
author = {Siyu Wu and Zihan Tang and Yuting Zeng and Hui Chen and Guiguang Ding and Tongxuan Liu and Ke Zhang and Hailong Yang},
journal= {arXiv preprint arXiv:2511.21862},
year = {2025}
}