多 LLM 路由中的不可解性上限:评估误产的实证研究
机器学习
2026-05-11 v1 人工智能
计算与语言
摘要
高效地跨多个 LLM 进行路由可通过将查询导向最具成本-质量权衡能力的模型来实现。先前的研究将路由余量归因于“不可解性上限”,即池中没有模型能够解决的查询。我们进行了大规模研究,使用 Gemma 4 和 Llama 3.1 系列,在六个基准数据集 (MMLU、MedQA、HumanEval、MBPP、Alpaca、ShareGPT) 上进行 206,000 组查询-模型组合的评估。采用 LLM 作为评判者和 exact-match 指标进行评估,我们发现大量报告的不可解性源于评估误产:(i) 评判者对 verbosity 相对于正确性的系统性偏好,(ii) 在固定生成预算下的截断,以及 (iii) 输出格式不匹配。通过双重评判者验证和 exact-match 锚定,我们降低了各任务中测量的不可解性。我们引入一种分解框架,将失败归因于这些误产,揭示了跨领域和模型家族一致的模式。这些误产也扭曲了路由器训练信号:标准路由器会坍缩为多数类预测 (~79% 最小层级最优),通过随机特征和随机标签控制得以确认,造成 13-17 个百分点的机会成本。我们提供了可操作的建议,包括双重评判者验证、exact-match 锚定和成本敏感目标。我们的发现表明,现有路由余量估计大幅被高估,凸显了多 LLM 系统中可靠评估协议的必要性。
引用
@article{arxiv.2605.07395,
title = {Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts},
author = {Saloni Garg and Amit Sagtani},
journal= {arXiv preprint arXiv:2605.07395},
year = {2026}
}
备注
12 pages, 14 tables