面向多模型 LLM 调度器:关于卸载与抢占的实证洞察
人工智能
2026-05-20 v1 分布式、并行与集群计算
摘要
大型语言模型(LLM)的现代部署日益需要在共享异构硬件上服务具有不同架构、规模和专化的多个模型。这种设置为资源分配、调度和调度带来了新挑战,尤其是在GPU内存受限的情况下,部分CPU-GPU卸载和抢占成为必要。虽然现有系统主要针对单个模型优化吞吐量,但鲜有工作针对此类条件下的多模型调度进行研究。本文对不同LLM在不同硬件平台上的行为进行实证研究,聚焦于图层卸载和抢占的性能影响。我们指出,卸载导致解码吞吐量呈强非线性且模型依赖的恳求降低,小型模型对GPU驻留率降低敏感性更强。我们进一步表明,抢占造成显著开销,主要由模型状态重新加载而非关键值缓存传输主导,此成本在不同模型和硬件平台间差异显著。此外,我们强调序列长度和互连带宽在放大数据移动和执行效率不足方面的作用。基于这些发现,我们确定未来调度器必须考虑的关键特征,包括模型特定的卸载灵敏性、工作负载特征以及抢占和数据传输的成本结构。这些洞察为下一代能够高效管理异构、多模型工作负载并支持混合CPU-GPU执行的LLM服务系统提供了指导。
引用
@article{arxiv.2605.19593,
title = {Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption},
author = {Mert Yildiz and Pietro Spadaccino and Alexey Rolich and Francesca Cuomo and Andrea Baiocchi},
journal= {arXiv preprint arXiv:2605.19593},
year = {2026}
}
备注
The 2026 Mediterranean Artificial Intelligence and Networking Conference (MAIN 2026)