中文

Justitia:基于选择性拖延调度任务并行 LLM 代理的公平性与效率

机器学习 2026-03-17 v2 人工智能 分布式、并行与集群计算

摘要

LLM 代理通常包含并行推理任务,用于解决实际问题。当在共享 GPU 服务器上服务此类任务并行 LLM 代理时,调度器需要实现快速代理完成,并保证最坏情况性能。在此目标下,我们的洞见是基于在理想公平共享下的完成顺序,对代理进行选择性拖延。我们设计了 Justitia,一个既公平又高效的任务并行 LLM 代理调度器。鉴于 LLM 服务中内存往往是瓶颈,Justitia 以内存为中心来量化代理的真实成本。它还采用一种轻量且准确的方法来预测代理成本。最后,Justitia 采用基于虚拟时间的公平队列算法,以保证最坏延迟。我们在 vLLM 上实现了 Justitia,实验结果显示,针对各种代理,能够在保持公平性的前提下显著提升调度效率。

关键词

引用

@article{arxiv.2510.17015,
  title  = {Justitia: Fair and Efficient Scheduling of Task-parallel LLM Agents with Selective Pampering},
  author = {Mingyan Yang and Guanjie Wang and Manqi Luo and Yifei Liu and Chen Chen and Han Zhao and Yu Feng and Quan Chen and Minyi Guo},
  journal= {arXiv preprint arXiv:2510.17015},
  year   = {2026}
}