中文

面向大语言模型的 MetaTool 基准:判断是否使用工具及使用哪一工具

软件工程 2024-12-06 v6 计算与语言

摘要

大语言模型(LLMs)因其令人印象深刻的自然语言处理(NLP)能力而获得了显著关注。近期,许多研究聚焦于 LLMs 的工具利用能力。它们主要探究 LLMs 如何与给定的特定工具有效协作。然而,在 LLMs 作为智能体的场景中,如 AutoGPT 和 MetaGPT 等应用所示,LLMs 被期望参与复杂的决策过程,包括判断是否使用工具并从可用工具集中选择最合适的一个或多个工具以满足用户请求。因此,在本文中,我们引入 MetaTool,一个旨在评估 LLMs 是否具备工具使用意识并能正确选择工具的基准。具体而言,我们在该基准中创建了一个称为 ToolE 的数据集。该数据集包含各类以提示形式触发的用户查询,促使 LLMs 使用工具,涵盖单工具与多工具场景。随后,我们设定了工具使用意识与工具选择两项任务。我们从不同角度在工具选择中定义了四个子任务,包括相似选项下的工具选择、特定场景中的工具选择、可能存在可靠性问题的工具选择,以及多工具选择。我们开展了涉及八个流行 LLMs 的实验,发现其中大多数仍难以有效选择工具,凸显了 LLMs 与真正智能体之间的现有差距。然而,通过错误分析,我们发现仍有显著改进空间。最后,我们总结了对工具开发者的见解——我们强烈建议工具开发者根据工具将应用的下游 LLM 选择合适的重写模型来生成新描述。我们的代码位于 https://github.com/HowieHwong/MetaTool。

关键词

引用

@article{arxiv.2310.03128,
  title  = {MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use},
  author = {Yue Huang and Jiawen Shi and Yuan Li and Chenrui Fan and Siyuan Wu and Qihui Zhang and Yixin Liu and Pan Zhou and Yao Wan and Neil Zhenqiang Gong and Lichao Sun},
  journal= {arXiv preprint arXiv:2310.03128},
  year   = {2024}
}