迈向协作LLM系统中路由器的公平与全面评估
计算与语言
2026-02-13 v1 人工智能
摘要
大型语言模型(LLM)已取得成功,但成本和隐私限制使得有必要在本地部署较小的模型,同时将复杂查询卸载到基于云的模型。现有的路由器评估缺乏系统性,忽视了特定场景的需求和分布外鲁棒性。我们提出了RouterXBench,一个原则性的评估框架,包含三个维度:路由器能力、场景对齐和跨领域鲁棒性。与依赖输出概率或外部嵌入的先前工作不同,我们利用在答案生成之前捕获模型不确定性的内部隐藏状态。我们引入了ProbeDirichlet,一个轻量级路由器,它通过可学习的狄利克雷分布和概率训练聚合跨层隐藏状态。在多领域数据上训练后,它在领域内和分布外场景中都能稳健地泛化。我们的结果表明,ProbeDirichlet在路由器能力和高精度场景中相较于最佳基线分别实现了16.68%和18.86%的相对改进,并且在模型家族、模型规模、异构任务和智能体工作流中表现一致。
引用
@article{arxiv.2602.11877,
title = {Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems},
author = {Wanxing Wu and He Zhu and Yixia Li and Lei Yang and Jiehui Zhao and Hongru Wang and Jian Yang and Benyou Wang and Bingyi Jing and Guanhua Chen},
journal= {arXiv preprint arXiv:2602.11877},
year = {2026}
}
备注
Our code is publicly available at https://github.com/zhuchichi56/RouterXBench