中文

面向 LLM �裁员的鲁棒自适应成本高效路由

人工智能 2026-05-12 v1 计算与语言 机器学习

摘要

具备推理能力的大语言模型 (LLM) 最近被采纳作为自动仲裁员,但其在 LLM 仲裁场景中的优势与代价仍不清晰。通过在需要结构化验证的任务(如数学和编程)和较简单评估之间进行受控比较,我们显示,显式推理在结构化验证任务上显著提高仲裁准确度,但在较简单评估中仅提供有限甚至消极的收益,并产生显著更高的计算成本。这些发现促使我们应当选择性地使用推理而非普遍使用,并注意可能的分布迁移。我们提出了鲁棒自适应成本高效路由 (RACER),通过将路由建模为受限分布鲁棒优化问题,在固定预算下动态选择推理与非推理仲裁员。RACER 明确考虑通过 KL 散度不确定性集表示分布迁移,接受有效的原始-对偶算法,并享有理论保证,包括最优策略的唯一性和线性收敛。广泛实验表明,RACER 在分布迁移下实现了优越的准确率-成本权衡。

关键词

引用

@article{arxiv.2605.10805,
  title  = {Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge},
  author = {Wenbo Zhang and Lijinghua Zhang and Liner Xiang and Hengrui Cai},
  journal= {arXiv preprint arXiv:2605.10805},
  year   = {2026}
}

备注

Accepted at ICML 2026