中文

ToolMATH:基于工具目录约束评估长期程工具使用的诊断基准

计算与语言 2026-05-19 v2 机器学习 软件工程

摘要

我们提出了\ToolMATH,这是一个以数学为基础的诊断基准,用于评估在可控工具目录条件下的长期程工具使用。\ToolMATH将逐步的MATH解答转换为具有自然语言描述和类型化模式的可重用Python工具,并将每个问题配对所需的工具环境,以实现顺序工具使用、中间结果复用和逻辑连贯的工具调用链。\ToolMATH通过构建金标准工具和带不同相似度的分级干扰项来控制工具可用性和目录难度。\ToolMATH还包含行为条件化指标,使诊断评估超越最终准确率。基于这些测量,\ToolMATH强调三个评估轴向:(1)\emph{适应性}衡量在金标准工具被完全替换为干扰项时,仅金标准成功率的保留程度;(2)\emph{鲁棒性}衡量在添加干扰项作为噪声时的稳定性;(3)\emph{工具连通性}衡量模型在长期执行的工具调用链中的准确率保持情况。进一步的轨迹级失败分析刻画了在每种工具目录条件下模型的失败方式。综合这些诊断,揭示了模型具有的不同轮廓:可靠工具使用、工具规避、适应性替代以及不可靠工具目录的影响。总体而言,\ToolMATH为评估语言模型如何适应变化的工具可用性、对干扰项保持鲁棒性以及在长期程工具使用轨迹中维持正确性提供了受控测试场。

关键词

引用

@article{arxiv.2602.21265,
  title  = {ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints},
  author = {Hyeonje Choi and Jeongsoo Lee and Hyojun Lee and Jay-Yoon Lee},
  journal= {arXiv preprint arXiv:2602.21265},
  year   = {2026}
}

备注

Submitted to NeurIPS Evaluation & Dataset Track