中文

ToolPlanner:一种用于多粒度指令的工具增强型 LLM,集路径规划与反馈机制

计算与语言 2024-11-05 v3 人工智能

摘要

最近,工具增强型大语言模型(tool-augmented LLMs)受到越来越多的关注。给定指令后,工具增强型大语言模型可进行多轮交互,调用各种外部工具,最终提供答案。然而,之前的模型是在过于详细的指令上训练的,这些指令包含 API 名称或参数,而真实用户不会明确提及这些 API 细节。这导致训练模型与实际场景之间存在差距。此外,大多数研究忽略了交互过程是否遵循指令。为此,我们构建了一个名为 MGToolBench 的训练数据集,其中包含语句和类别级别的指令,以更好地反映真实场景。此外,我们提出了 ToolPlanner,一个两阶段强化学习框架,利用路径规划和两种反馈机制来增强大语言模型的任务完成能力和指令遵循能力。实验结果表明,与当前最先进模型相比,ToolPlanner 在匹配率、通过率和胜率上分别提高了 26.8%、20.2% 和 5.6%。人类评估验证,多粒度指令能更好地符合用户的使用习惯。我们的数据和代码将在接受后公开。

关键词

引用

@article{arxiv.2409.14826,
  title  = {ToolPlanner: A Tool Augmented LLM for Multi Granularity Instructions with Path Planning and Feedback},
  author = {Qinzhuo Wu and Wei Liu and Jian Luan and Bin Wang},
  journal= {arXiv preprint arXiv:2409.14826},
  year   = {2024}
}