RACER:面向大语言模型的风险感知校准高效路由
机器学习
2026-03-10 v1 人工智能
统计理论
统计理论
摘要
高效地将查询路由到最优的大语言模型(LLM)对于优化多模型系统的成本性能权衡至关重要。然而,大多数现有路由器依赖单模型选择,容易受到误路由。本文将LLM路由建模为α-VOR问题,以最小化预期集合大小同时控制误路由风险,提出新方法——RACER,将基础路由器扩展为输出模型集合,可随后进行聚合以获得更好的输出。具体而言,RACER通过增强评分构建嵌套模型集合,并利用有限样本浓度不等式校准阈值,以实现可变集合大小和回避机制。我们理论上证明,RACER在事后和模型无关的方式下,对未见测试数据实现严格的分布无关风险控制。广泛的实验验证了我们的理论保证,表明RACER在广泛的基准测试中 consistently 提升下游准确率。
引用
@article{arxiv.2603.06616,
title = {RACER: Risk-Aware Calibrated Efficient Routing for Large Language Models},
author = {Sai Hao and Hao Zeng and Hongxin Wei and Bingyi Jing},
journal= {arXiv preprint arXiv:2603.06616},
year = {2026}
}