工具十字:面向多样化、真实且长期程度任务执行的语言代理基准
计算与语言
2026-02-27 v2 人工智能
摘要
现实世界的语言代理必须处理跨多个应用的复杂、多步骤工作流程。例如,代理可能通过协调日历和文件系统来管理电子邮件,或监控生产数据库以检测异常并遵循操作手册生成报告。然而,现有的语言代理基准常常聚焦于狭窄领域或简化任务,缺乏所需的多样性、真实性和长期程度复杂度来评估代理的实际性能。为填补这一空白,我们引入工具十字(Toolathlon),作为语言代理的基准,提供多样化的应用和工具、真实的环境设置以及可靠的基于执行的评估。Toolathlon 覆盖 32 个软件应用和 604 个工具,从日常平台如 Google 日历和 Notion 到专业平台如 WooCommerce、Kubernetes 和 BigQuery。大多数工具基于我们自行修订或实现的高质量 Model Context Protocol(MCP)服务器。与 prior 工作不同,后者主要确保功能上的真实性,但提供有限的环境状态多样性;我们提供来自真实软件的真实初始环境状态,例如包含数十名学生的 Canvas 课程或真实财务表格。该基准包括 108 个手动来源或精心设计的任务,总计要求在平均约 20 步后与多个应用交互完成。每个任务都通过专用的评估脚本进行严格验证。对 SOTA 模型的全面评估突显了其显著不足:表现最好的模型 Claude-4.5-Sonnet 仅实现 38.6% 的成功率,平均使用 20.2 次工具调用;top open-weights 模型 DeepSeek-V3.2-Exp 达到 20.1%。我们期待 Toolathlon 将推动更高级语言代理在真实、长期程度任务执行方面的发展。
引用
@article{arxiv.2510.25726,
title = {The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution},
author = {Junlong Li and Wenshuo Zhao and Jian Zhao and Weihao Zeng and Haoze Wu and Xiaochen Wang and Rui Ge and Yuxuan Cao and Yuzhen Huang and Wei Liu and Junteng Liu and Zhaochen Su and Yiyang Guo and Fan Zhou and Lueyang Zhang and Juan Michelini and Xingyao Wang and Xiang Yue and Shuyan Zhou and Graham Neubig and Junxian He},
journal= {arXiv preprint arXiv:2510.25726},
year = {2026}
}
备注
ICLR 2026, Website: https://toolathlon.xyz/