中文

面向长期轨迹代理工作流的突出现象委派基准测试

人工智能 2026-05-20 v1 计算与语言 多智能体系统

摘要

我们介绍了 DecisionBench,这是一个用于在长期轨迹代理工作流中实现突出现象委派的基准测试基座。该基座固定了任务套件 (GAIA、tau-bench、BFCL multi-turn)、对等模型池 (11 个模型、7 个供应商家族)、委派接口 (call_model 外加可选的 read_profile 通道)、确定性技能标注层,以及覆盖质量、成本、延迟、委派率、路由保真度-在-k 处、供应商自偏好以及反事实委派上限的多维度指标套件。该基座对对等信息的生成方式或递送方式不敏感,因此学习型路由器、更丰富的对等记忆、自适应概要构建,以及多步骤委派都可针对其进行评估。我们对该基座进行了五条件参考扫描(针对完整模型池,n=23,375 个任务实例)。从三方面基准发现:(i) 平均最终任务质量在四个意识条件下在统计上不可区分(|beta| <= 0.010, p >= 0.21),因此仅凭质量评估会错失编排信号;(ii) 在意识条件下的路由保真度-在-1 范围从 7.5% 到 29.5%,且在平均质量基本相等的情况下,交付渠道(按需工具 vs. 预加载描述)主导描述内容;(iii) 反事实上限将完美委派置于测量性能之上 15-31 个百分点,在每个套件上均定位了大量未实现的潜在空间,为未来的编排方法提供了方向。我们发布了该基座、标注层、参考干预套件、分析管道,以及 220 个每条件运行存档。

关键词

引用

@article{arxiv.2605.19099,
  title  = {DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows},
  author = {Yuxuan Gao and Megan Wang and Yi Ling Yu and Zijian Carl Ma and Ao Qu},
  journal= {arXiv preprint arXiv:2605.19099},
  year   = {2026}
}

备注

28 pages, 9 figures, 11 tables. Code and data: https://huggingface.co/decisionbench