中文

通过上下文队列多臂老虎机学习 LLM 的路由与调度策略

机器学习 2026-02-03 v1

摘要

对 LLM 的需求激增常导致用户查询在服务器队列中积压,需高效的路由(查询-LLM 匹配)和调度(查询优先级)机制。虽然已有多种线上算法部署,但忽略了对话式 LLM 服务的以下两个关键挑战:(1)未满足的用户可能重试查询,增加服务器积压;(2)请求“显式”反馈(如评分)会降低用户体验。本文开发联合路由与调度算法,利用来自用户重试行为推断的“隐式”反馈。核心思想是提出并研究基于多项逻辑反馈的上下文队列多臂老虎机框架(CQB-MNL)。CQB-MNL 模型查询重试行为及基于上下文的用户偏好学习。我们的算法 anytime CQB(ACQB)通过结合 Thompson 采样与衰减速率的强制探索,实现高效学习并维持队列稳定。我们证明 ACQB 同时实现路由的累积报酬为 O~(t)\widetilde{\mathcal{O}}(\sqrt{t}),队列长度报酬为 O~(t1/4)\widetilde{\mathcal{O}}(t^{-1/4})。实验中,我们通过对比学习细化查询嵌入,采用 disjoint 参数模型学习 LLM 特定参数。基于 SPROUT、EmbedLLM 和 RouterBench 数据集的实验表明,两种算法均一致优于基线方法。

关键词

引用

@article{arxiv.2602.02061,
  title  = {Learning to Route and Schedule LLMs from User Retrials via Contextual Queueing Bandits},
  author = {Seoungbin Bae and Junyoung Son and Dabeen Lee},
  journal= {arXiv preprint arXiv:2602.02061},
  year   = {2026}
}