Kairos:面向公共云中高负载场景的低时延多智能体服务
分布式、并行与集群计算
2025-08-12 v1
摘要
多智能体应用利用大型语言模型(LLM)的高级能力,通过智能体协作完成复杂任务。在这种情况下,来自不同智能体的请求通常会访问相同的共享 LLM 以执行不同类型的任务,导致共享 LLM 承受过载。然而,现有工作因忽略请求调度中智能体间的时延差异和资源差异,导致多智能体应用的服务性能较差。因此,我们提出了 Kairos,一个面向多智能体应用的 orchestration 系统,通过优化端到端时延来提升性能。Kairos 由工作流编排器、工作流感知优先级调度器和内存感知调度器组成。编排器收集智能体特定信息以进行在线工作流分析。调度器根据请求的时延特征决定其服务优先级,以减少整体排队。调度器根据请求的内存需求将请求分配到不同的 LLM 实例,以避免 GPU 过载。实验结果表明,与最新方法相比,Kairos 将端到端时延降低 17.8%~28.4%。
引用
@article{arxiv.2508.06948,
title = {Kairos: Low-latency Multi-Agent Serving with Shared LLMs and Excessive Loads in the Public Cloud},
author = {Jinyuan Chen and Jiuchen Shi and Quan Chen and Minyi Guo},
journal= {arXiv preprint arXiv:2508.06948},
year = {2025}
}