中文

StableToolBench:面向大语言模型工具学习的稳定大规模基准测试

计算与语言 2025-03-06 v5

摘要

近年来,大型语言模型取得了显著进展,促使了对工具学习的探索,即将 LLM 与外部工具结合以应对各种现实挑战。评估 LLM 使用工具的能力需要大规模且稳定的基准测试。然而,先前的工作要么依赖于规模有限的手工制作在线工具,要么依赖于受 API 状态不稳定性影响的大规模真实在线 API。为了解决这个问题,我们引入了 StableToolBench,这是一个由 ToolBench 演变而来的基准测试,提出了虚拟 API 服务器和稳定的评估系统。虚拟 API 服务器包含缓存系统和 API 模拟器,二者互补以缓解 API 状态的变化。同时,稳定的评估系统使用 GPT-4 作为自动评估器设计了可解通过率和胜率,以消除评估过程中的随机性。实验结果证明了 StableToolBench 的稳定性,并进一步讨论了 API 模拟器、缓存系统和评估器系统的有效性。

关键词

引用

@article{arxiv.2403.07714,
  title  = {StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models},
  author = {Zhicheng Guo and Sijie Cheng and Hao Wang and Shihao Liang and Yujia Qin and Peng Li and Zhiyuan Liu and Maosong Sun and Yang Liu},
  journal= {arXiv preprint arXiv:2403.07714},
  year   = {2025}
}