中文

神奇智能体竞赛:强大的工具使用者,糟糕的导航员

人工智能 2026-04-20 v2 计算与语言 机器学习

摘要

现有针对LLM智能体的工具使用基准测试绝大多数是线性的:我们对六个基准测试的分析显示,55%到100%的实例是2到5步的简单链。我们引入了The Amazing Agent Race(AAR),这是一个以有向无环图(DAG)谜题(或“赛段”)为特色的基准测试,包含分叉-合并工具链。我们发布了两个变体的1400个实例:顺序型(800个赛段)和组合型(600个DAG赛段)。智能体必须导航维基百科,执行多步工具链,并将结果聚合为可验证的答案。赛段从维基百科种子程序化生成,涵盖四个难度级别,并通过实时API进行验证。三个互补指标(终点线准确率、停靠站访问率和路障完成率)分别诊断导航、工具使用和算术失败。在1400个赛段上评估三个智能体框架,最佳准确率仅为37.2%。导航错误占主导(27%到52%的试验),而工具使用错误低于17%,并且智能体架构与模型规模同等重要(Claude Code以少6倍的token消耗达到与Codex CLI相当的37%准确率)。AAR的组合结构揭示了智能体的失败不在于调用工具,而在于导航到正确的页面,这是线性基准测试无法发现的盲点。项目页面可访问:https://minnesotanlp.github.io/the-amazing-agent-race

关键词

引用

@article{arxiv.2604.10261,
  title  = {The Amazing Agent Race: Strong Tool Users, Weak Navigators},
  author = {Zae Myung Kim and Dongseok Lee and Jaehyung Kim and Vipul Raheja and Dongyeop Kang},
  journal= {arXiv preprint arXiv:2604.10261},
  year   = {2026}
}