中文

EWSJF:一种用于混合工作负载 LLM 推理的自适应混合分区调度器

分布式、并行与集群计算 2026-01-30 v1 人工智能

摘要

在混合工作负载下服务大型语言模型(LLM)——即短暂且具有时延敏感性的交互查询与长期且注重吞吐的批处理请求——面临着根本性的调度挑战。标准的先来先服务(FCFS)策略会导致严重的队首阻塞,引发高尾部时延和硬件资源 underutilization。我们引入 EWSJF(有效工作负载最短作业优先),这是一种自适应的请求级调度器,能够实时学习工作负载结构以在公平性和吞吐之间实现协同优化。EWSJF 位于执行级调度器之上,集成了四个组件:(1) 精炼-修剪,一种无监督分区算法发现性能均匀的请求组;(2) 动态队列路由,用于将请求分配给这些组;(3) 密度加权评分,一种基于上下文的优先级函数在紧迫性和公平性之间进行平衡;(4) 贝叶斯元优化,不断根据实时性能反馈调优评分和分区参数。实现于 vLLM 中,EWSJF 比 FCFS 提高了 30% 以上的端到端吞吐,并将短请求的平均首字时延降低最高可达 4 倍。这些结果表明,自适应、基于学习的请求调度是高效且响应式 LLM 服务的关键缺失层。实现代码已公开于 https://anonymous.4open.science/r/vllm_0110-32D8。

关键词

引用

@article{arxiv.2601.21758,
  title  = {EWSJF: An Adaptive Scheduler with Hybrid Partitioning for Mixed-Workload LLM Inference},
  author = {Bronislav Sidik and Chaya Levi and Joseph Kampeas},
  journal= {arXiv preprint arXiv:2601.21758},
  year   = {2026}
}