中文

工具文档使大语言模型实现零样本工具使用

计算与语言 2023-08-02 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

如今,大语言模型(LLMs)通过学习工具使用的一些演示来学会使用新工具。遗憾的是,演示难以获取,且若选择了错误的演示会导致不良的偏置使用。即使在演示易于获取的罕见情况下,也没有原则性的选择协议来确定应提供多少以及哪些演示。随着任务变得复杂,选择搜索呈组合式增长并不可避免地变得难以处理。我们的工作提供了一种演示的替代方案:工具文档。我们主张使用工具文档(针对单个工具使用的描述)而非演示。我们通过跨视觉与语言模态的 6 项任务上的三个主要实证发现来证实我们的主张。首先,在现有基准上,仅含工具文档的零样本提示足以引发正确的工具使用,达到与少样本提示相当的性能。其次,在一个新收集的具有数百个可用工具 API 的真实工具使用数据集上,我们表明工具文档比演示更有价值,零样本文档显著优于无文档的少样本。第三,我们通过使用刚发布的先进模型作为工具进行图像生成与视频跟踪,凸显了工具文档的优势。最后,我们强调利用工具文档自动实现新应用的可能性:仅使用 GroundingDino、Stable Diffusion、XMem 和 SAM 的文档,LLMs 就能重新发明刚发布的 Grounded-SAM 与 Track Anything 模型的功能。

关键词

引用

@article{arxiv.2308.00675,
  title  = {Tool Documentation Enables Zero-Shot Tool-Usage with Large Language Models},
  author = {Cheng-Yu Hsieh and Si-An Chen and Chun-Liang Li and Yasuhisa Fujii and Alexander Ratner and Chen-Yu Lee and Ranjay Krishna and Tomas Pfister},
  journal= {arXiv preprint arXiv:2308.00675},
  year   = {2023}
}