AgentEscapeBench:评估LLM代理在超出域范围的工具 grounding 推理能力
人工智能
2026-05-21 v2
摘要
随着基于大语言模型的代理系统越来越多地依赖外部工具,评估其在熟悉工作流程和短程交互之外维持工具 grounding 推理能力变得至关重要。我们介绍了 AgentEscapeBench,这是一个类似逃脱房间的基准测试,旨在测试代理是否能够在明确的长程依赖约束下推断、执行和修订新颖的工具使用程序。每个任务在工具和物品之间定义一个有向无环依赖图,要求代理调用真实的外部函数、跟踪逐步揭露的隐藏状态、传递中间结果,并提交一个确定性可验证的最终答案。AgentEscapeBench 包含 270 个实例,分为五个难度等级,并支持完全自动化评估。对十六个 LLM 代理和人类参与者的实验显示,随着依赖深度增加,性能急剧下降:人类在难度 5 时成功率为 98.3%,在难度 25 时降至 80.0%,而最佳模型则从 90.0%降至 60.0%。轨迹分析将模型失败主要归因于长程状态跟踪、线索遵循和中间结果传递中的失效。这些发现表明,当前的代理系统通常能够处理局部工具使用,但在处理深层上下文依赖方面仍存在挑战。我们希望 AgentEscapeBench 能作为诊断当前代理能力的基准测试平台,并为未来致力于更健全通用推理、行动和适应能力的训练工作提供指导。
引用
@article{arxiv.2605.07926,
title = {AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents},
author = {Zhengkang Guo and Yiyang Li and Lin Qiu and Xiaohua Wang and Jingwen Xv and Dongyu Ru and Xiaoyu Li and Xiaoqing Zheng and Xuezhi Cao and Xunliang Cai},
journal= {arXiv preprint arXiv:2605.07926},
year = {2026}
}