中文

TwinRouterBench:用于现实感代理 LLM 路由的快速静态与动态评估

机器学习 2026-05-25 v2 人工智能

摘要

LLM 路由在编码代理、深度研究系统和计算机使用代理等长期视角应用中尤为重要,其中单个用户请求会触发大量模型调用。将每个调用路由到最具性价比的模型可在不牺牲质量的前提下显著降低成本,但现有路由基准仅针对单次提示进行评估。它们从未在中间代理步骤中暴露路由器可见的前缀,也从未测试更便宜的替换方案是否能保持下游任务成功,且常常依赖在线 LLM 评判器进行评估。我们提出 TwinRouterBench,一个基于步骤级别的路由基准,包含两个轨道。静态轨道提供来自 SWE-bench、BFCL、mtRAG、QMSum 和 PinchBench 的 520 个实例中 970 个路由器可见前缀,每个前缀都配有经发布的降级-级联协议估算的执行验证目标层级;评分基于层级标签、轨迹成员身份和 token 成本的确定性算术,无需在线评估器端 LLM 评判器。动态轨道提供一个可在完整 500 案例的 SWE-bench Verified 套件上运行路由器的框架;本文报告 100 案例的持留留评估,与静态 SWE 监督分割 disjoint。每次 LLM 调用时,路由器从锁定的模型池中选择具体模型,成功由官方任务解决和实现的 API 花费衡量。两个轨道支持快速的离线迭代, followed by live agent 执行下的端到端验证。代码和数据已发布于 https://github.com/CommonstackAI/TwinRouterBench。

关键词

引用

@article{arxiv.2605.18859,
  title  = {TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing},
  author = {Pei Yang and Wanyi Chen and Tongyun Yang and Pengbin Feng and Jiarong Xing and Wentao Guo and Yuhang Yao and Yuhang Han and Hanchen Li and Xu Wang and Zeyu Wang and Jie Xiao and Anjie Yang and Liang Tian and Lynn Ai and Eric Yang and Tianyu Shi},
  journal= {arXiv preprint arXiv:2605.18859},
  year   = {2026}
}