中文

Niyama:打破 LLM 推理服务的异构设施

机器学习 2025-03-31 v1 人工智能 分布式、并行与集群计算

摘要

大型语言模型 (LLMs) 的广泛采用已使 diverse applications 能够实现具有不同延迟要求的功能。现有的 LLM 服务框架依赖于粗粒度工作负载隔离的异构设施 -- 交互式和批处理 -- 导致资源利用效率低下且对细粒度质量-of-service (QoS) 差异支持有限。这导致运营效率低下、资源超配以及在流量激增期间的差异化负载管理。我们提出 Niyama,一种新颖的 QoS 驱动的推理服务系统,能够在共享设施上高效地协调 diverse workloads。Niyama 引入细粒度 QoS 分类,允许应用程序指定精确的延迟要求,并根据实时系统状态动态调整调度决策。利用 LLM 推理的可预测执行特征,Niyama 实现一种动态分块机制,以在保持严格 QoS 保证的同时提高总体吞吐量。此外,Niyama 采用混合优先级策略以平衡公平性和效率,并采用选择性请求 relegation 以实现过载条件下的优雅服务降级。我们的评估表明,与当前的异构部署相比,Niyama 将服务容量提高 32%,同时保持 QoS 保证。值得注意的是,在极端负载下,我们的系统比当前策略减少一个数量级的 SLO 违规。

关键词

引用

@article{arxiv.2503.22562,
  title  = {Niyama : Breaking the Silos of LLM Inference Serving},
  author = {Kanishk Goel and Jayashree Mohan and Nipun Kwatra and Ravi Shreyas Anupindi and Ramachandran Ramjee},
  journal= {arXiv preprint arXiv:2503.22562},
  year   = {2025}
}