SeqRoute:基于离线强化学习的全局预算感知的顺序LLM路由
机器学习
2026-05-26 v1 人工智能
摘要
现有的LLM路由框架将查询视为独立事件,忽略了受全局计算预算约束的真实用户会话的序列性质。这一不匹配必然导致预算破产:狭隘的路由策略在早期交互中耗尽资源,迫使后续且往往更复杂的查询被路由到不足的模型上。我们引入SeqRoute,一个将多轮路由建模为有限时域马尔可夫决策过程并通过离线强化学习求解的框架。通过将剩余预算纳入状态空间并使用保守Q学习(CQL)进行训练,SeqRoute学习延迟满足,以在会话后期的高风险回合中战略性地保留资源。为克服数据匮乏,我们提出Hindsight Budget Relabeling(HBR)。该技术通过在各种假设预算下拟回历史轨迹,扩展10,000个原始会话为238万个包含关键破产信号的转换。部署时,动态的λ-sweep机制可在无需重新训练的情况下实现成本-质量Pareto前沿的零样导航。广泛的评估表明,SeqRoute在保持或提高质量的同时将运营成本降低6.0%-73.5%,并将破产率压制在1%以下,在整个Pareto前沿上均显著优于行为克隆、预算感知启发式方法和静态基线。
引用
@article{arxiv.2605.25424,
title = {SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning},
author = {Zhongling Xu and Shunan Zheng and Wei Wang},
journal= {arXiv preprint arXiv:2605.25424},
year = {2026}
}