面向大型语言模型的稳健批级查询路由:在成本与容量约束下
机器学习
2026-03-31 v1 人工智能
机器学习
摘要
我们研究了在成本、GPU 资源和并发约束下将查询路由到大型语言模型 (LLM) 的问题。先前的 per-query 路由方法在控制批级成本方面往往失败,尤其是在非均匀或对抗性批处理情况下。为此,我们提出了一个批级、资源感知的路由框架,联合优化每个批次的模型分配,同时遵守成本和模型容量限制。我们进一步引入了一种稳健变体,考虑预测 LLM 性能的不确定性,同时引入一个离线实例分配程序,在多个模型之间平衡质量和吞吐量。实验在两个多任务 LLM 基准上表明,稳健性在性能估计器不同情况下使准确率提高 1-14%,批级路由在对抗性批处理下相对于 per-query 方法提高最多 24%,优化的实例分配相对于非优化分配再提高最多 3%,同时严格控制成本和 GPU 资源约束。
引用
@article{arxiv.2603.26796,
title = {Robust Batch-Level Query Routing for Large Language Models under Cost and Capacity Constraints},
author = {Jelena Markovic-Voronov and Kayhan Behdin and Yuanda Xu and Zhengze Zhou and Zhipeng Wang and Rahul Mazumder},
journal= {arXiv preprint arXiv:2603.26796},
year = {2026}
}