ToolLLM:赋能大语言模型掌握 16000+ 真实世界 API
人工智能
2023-10-04 v2 计算与语言
机器学习
摘要
尽管开源大语言模型(LLM),例如 LLaMA,取得了进展,它们在工具使用能力(即使用外部工具(API)来完成人类指令)方面仍然受到显著限制。原因在于当前的指令微调主要聚焦于基础语言任务,而忽视了工具使用领域。这与最先进(SOTA)的闭源 LLM(例如 ChatGPT)出色的工具使用能力形成对比。为弥补这一差距,我们提出了 ToolLLM,一个涵盖数据构建、模型训练与评估的通用工具使用框架。我们首先提出 ToolBench,一个用于工具使用的指令微调数据集,其由 ChatGPT 自动构建。具体而言,构建可分为三个阶段:(i)API 收集:我们从 RapidAPI Hub 收集了涵盖 49 个类别的 16,464 个真实世界 RESTful API;(ii)指令生成:我们提示 ChatGPT 生成涉及这些 API 的多样化指令,覆盖单工具与多工具场景;(iii)解路径标注:我们使用 ChatGPT 为每个指令搜索有效的解路径(API 调用链)。为增强 LLM 的推理能力,我们开发了一种基于深度优先搜索的决策树新算法。它使 LLM 能够评估多个推理轨迹并扩展搜索空间。此外,为评估 LLM 的工具使用能力,我们开发了自动评估器:ToolEval。基于 ToolBench,我们将 LLaMA 微调得到 LLM ToolLLaMA,并为其配备神经 API 检索器以为每条指令推荐合适的 API。实验表明,ToolLLaMA 展现出执行复杂指令和泛化至未见 API 的卓越能力,并表现出与 ChatGPT 相当的性能。我们的 ToolLLaMA 在分布外工具使用数据集 APIBench 中也展现出强大的零样本泛化能力。
引用
@article{arxiv.2307.16789,
title = {ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs},
author = {Yujia Qin and Shihao Liang and Yining Ye and Kunlun Zhu and Lan Yan and Yaxi Lu and Yankai Lin and Xin Cong and Xiangru Tang and Bill Qian and Sihan Zhao and Lauren Hong and Runchu Tian and Ruobing Xie and Jie Zhou and Mark Gerstein and Dahai Li and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2307.16789},
year = {2023}
}