中文

ZEBRAARENA:用于研究LLM工具增强推理-行动耦合的诊断仿真环境

人工智能 2026-03-20 v1

摘要

工具增强型大语言模型 (LLM) 必须紧密耦合多步骤推理与外部行动,但现有基准往往使这种互动与复杂环境动力学、记忆知识或数据集污染混合。在本文中,我们介绍 ZebraArena,这是一个程序生成的诊断环境,用于研究 LLM 的推理-行动耦合,具有可控难度和知识最小化设计,这限制了通过记忆或数据集污染获得的收益。ZebraArena 中的每个任务都需要一组关键信息,这些信息只能通过针对性工具使用获得,为外部信息获取与推理推理提供可解释的接口。该设计通过唯一解和衡量高效工具使用的理论最优查询次数,实现确定性评估。我们表明,ZebraArena 需要深度推理和准确的外部工具调用相结合,这仍然是一个挑战,因为前沿推理模型如 GPT-5 和 Gemini 2.5 Pro 仅在困难实例上实现 60% 的准确率。我们还观察到理论最优性与实际工具使用的持续差距。例如,GPT-5 使用的工具调用次数比理论最优高出 70-270%。我们概述了在我们的评估中所发现的关键发现,并希望 ZebraArena 能激发进一步的研究,关注内部推理与外部行动之间的相互作用。

关键词

引用

@article{arxiv.2603.18614,
  title  = {ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs},
  author = {Wanjia Zhao and Ludwig Schmidt and James Zou and Vidhisha Balachandran and Lingjiao Chen},
  journal= {arXiv preprint arXiv:2603.18614},
  year   = {2026}
}