ToolHop:用于评估大型语言模型多跳工具使用的查询驱动基准
计算与语言
2025-05-21 v4
摘要
有效评估多跳工具使用对于分析大型语言模型(LLMs)的理解、推理和函数调用能力至关重要。然而,由于缺乏可靠的评估数据集,进展受到阻碍。为了解决这个问题,我们提出了ToolHop,一个包含995个用户查询和3912个相关工具的数据集,专门用于严格评估多跳工具使用。ToolHop通过一种新颖的查询驱动数据构建方法,包括工具创建、文档细化和代码生成,确保了多样化的查询、有意义的相互依赖、本地可执行工具、详细反馈和可验证的答案。我们评估了五个模型系列(即LLaMA3.1、Qwen2.5、Gemini1.5、Claude3.5和GPT)中的14个LLM,揭示了处理多跳工具使用场景的重大挑战。领先模型GPT-4o的准确率为49.04%,表明仍有很大的改进空间。进一步的分析揭示了不同系列的工具使用策略的差异,为开发更有效的方法提供了可操作的见解。代码和数据可在https://huggingface.co/datasets/bytedance-research/ToolHop获取。
引用
@article{arxiv.2501.02506,
title = {ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use},
author = {Junjie Ye and Zhengyin Du and Xuesong Yao and Weijian Lin and Yufei Xu and Zehui Chen and Zaiyuan Wang and Sining Zhu and Zhiheng Xi and Siyu Yuan and Tao Gui and Qi Zhang and Xuanjing Huang and Jiecao Chen},
journal= {arXiv preprint arXiv:2501.02506},
year = {2025}
}
备注
Accepted by ACL 2025 Main Conference