中文

面向 LLM 推理优化的 Workload-Router-Pool 架构:来自 vLLM 语义路由项目的愿景论文

机器学习 2026-04-10 v2 分布式、并行与集群计算

摘要

过去一年,vLLM 语义路由项目发布了一系列工作:(1) 核心路由机制——信号驱动路由、上下文长度池路由、路由性能工程、策略冲突检测、低延迟嵌入模型、类别感知语义缓存、用户反馈驱动的路由适应、幻觉检测以及针对隐私和越狱保护的层次化内容安全分类; (2) fleet 优化——fleet provisioning 和能源效率分析; (3) agentic 和多模态路由——多模态 agent 路由、工具选择、CUA 安全以及多轮上下文记忆和安全; (4) 治理和标准——推理路由协议和多提供商 API 扩展。每篇论文解决 LLM 推理中的具体问题,但这些问题并非独立;例如,fleet provisioning 取决于路由策略,而路由策略又取决于工作负载混合,随着组织采用 agentic 和多模态工作负载而不断变化。本文将这些结果提炼为 Workload-Router-Pool (WRP) 架构,这是一个用于 LLM 推理优化的三维框架。Workload 描述 fleet 提供的是什么内容(聊天 vs. agent,单轮 vs. 多轮,温 vs. 冷,prefill 重 vs. decode 重)。Router 决定如何分发每个请求(静态语义规则、在线 bandit 适应、RL 基于模型选择、质量感知级联)。Pool 定义推理运行的地方(同构 vs. 异构 GPU,解耦 prefill/decode,KV-cache 拓扑)。我们将 prior work 映射到 3x3 WRP 交互矩阵上,识别我们覆盖了哪些单元格以及哪些仍待开放,并在交叉点提出 21 个具体研究方向,每个都基于我们的 prior 测量,依据成熟度从工程就绪到开放研究进行分层。

关键词

引用

@article{arxiv.2603.21354,
  title  = {The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project},
  author = {Huamin Chen and Xunzhuo Liu and Bowei He and Fuyuan Lyu and Yankai Chen and Xue Liu and Yuhan Liu and Junchen Jiang},
  journal= {arXiv preprint arXiv:2603.21354},
  year   = {2026}
}

备注

Vision Paper