中文

开源大语言模型的工具操纵能力探究

计算与语言 2023-05-29 v1 人工智能 机器学习

摘要

近期关于大语言模型(LLM)软件工具操纵的研究大多依赖封闭模型 API。由于向封闭 LLM API 服务暴露信息所带来的安全性与鲁棒性风险,这些模型的工业应用受到显著制约。在本文中,我们探讨:以实际量级的人类监督,能否增强开源 LLM 使其在工具操纵上媲美领先的封闭 LLM API。通过分析常见的工具操纵失败,我们首先表明开源 LLM 可能需要使用示例、上下文演示与生成风格规约进行训练以解决失败。这些见解促使我们重访 LLM 文献中的经典方法,并展示可将其适配为借助程序化数据生成、系统提示与上下文演示检索器的模型对齐,以增强开源 LLM 的工具操纵能力。为评估这些技术,我们创建了 ToolBench,一个由真实世界任务中多样软件工具构成的工具操纵基准。我们展示我们的技术可将领先的开源 LLM 成功率提升多达 90%,在 8 项 ToolBench 任务中的 4 项上展现出与 OpenAI GPT-4 相竞争的能力。我们表明此类增强通常需约一个开发者日来为每个工具策划数据,构成了具有实际量级人类监督的方案。

关键词

引用

@article{arxiv.2305.16504,
  title  = {On the Tool Manipulation Capability of Open-source Large Language Models},
  author = {Qiantong Xu and Fenglu Hong and Bo Li and Changran Hu and Zhengyu Chen and Jian Zhang},
  journal= {arXiv preprint arXiv:2305.16504},
  year   = {2023}
}