基于 NeuralUCB 的奖励驱动的在线 LLM 路由
机器学习
2026-04-01 v1 计算与语言
摘要
本研究探讨了 NeuralUCB 用于大语言模型(LLM)路由的成本效益问题。现有的路由方法可大致分为监督式路由方法和部分反馈方法,每种方法在效率和适应性之间具有不同的权衡。我们实现了基于 NeuralUCB 的路由策略,并在 RouterBench 的模拟在线环境下进行评估。实验结果表明,所提出的方法在奖励效用上持续优于随机和最小成本基线。相较于最大质量参考,本方法在保持具竞争力的奖励的同时,实现了显著降低的推理成本。这一发现表明,NeuralUCB 是一种值得期待的成本感知 LLM 路由方法,同时也突显了在动作判别和探索方面的剩余挑战。
引用
@article{arxiv.2603.30035,
title = {Reward-Based Online LLM Routing via NeuralUCB},
author = {Ming-Hua Tsai and Phat Tran},
journal= {arXiv preprint arXiv:2603.30035},
year = {2026}
}