中文

Aragog:面向智能体工作流可扩展服务的即时模型路由

分布式、并行与集群计算 2025-12-15 v2

摘要

智能体工作流已成为解决复杂多阶段任务的强大范式,但大规模服务这些工作流计算成本高昂,因为每个请求必须经过多次大语言模型(LLM)推理。配置选择,即根据成本将工作流智能体分配给特定 LLM,可以降低这些成本,但现有方法在请求执行前就绑定了配置决策,使其不适合工作流异构且冗长的执行过程。具体而言,系统负载在请求生命周期内可能快速且大幅波动,导致固定配置迅速变得次优。我们提出 Aragog,一个在请求执行过程中逐步调整其配置以适应运行时动态的系统。为了在巨大的工作流配置空间中使这一做法切实可行,Aragog 将问题解耦为两个核心要素——一个一次性路由步骤,用于识别所有保持精度的配置,以及一个低成本的逐阶段调度器,利用最新的系统观测结果从中选择配置——并引入了新颖策略来加速每个步骤。在多种工作流和模型家族中,Aragog 将最大服务吞吐量提高了 50.0% 至 217.0%,并在峰值请求率下将中位延迟降低了 32.5% 至 78.9%,同时保持与最昂贵配置相当的精度。

关键词

引用

@article{arxiv.2511.20975,
  title  = {Aragog: Just-in-Time Model Routing for Scalable Serving of Agentic Workflows},
  author = {Yinwei Dai and Zhuofu Chen and Anand Iyer and Ravi Netravali},
  journal= {arXiv preprint arXiv:2511.20975},
  year   = {2025}
}