中文

ToolTalk:在对话场景中评估工具使用

计算与语言 2023-11-21 v1 人工智能 机器学习

摘要

大语言模型(LLMs)在推理与决策能力上展现出巨大提升,并能与用户进行自然对话。许多近期工作试图为基于 LLM 的助手增强外部工具,使其能访问私有或最新信息并代用户执行操作。为更好地衡量这些助手的性能,本文引入 ToolTalk,一个由复杂用户意图组成的基准,这些意图需要通过对话指定的多步工具使用。ToolTalk 包含分为 7 个插件的 28 个工具,并为每个工具提供了完整的模拟实现,从而可对依赖执行反馈的助手进行全自动化评估。ToolTalk 还强调对外部世界产生实际影响的工具,而非仅用于引用或搜索信息的工具。我们在 ToolTalk 上评估了 GPT-3.5 和 GPT-4,成功率分别为 26% 和 50%。我们对错误的分析揭示了三大主要类别,并给出了一些未来改进方向。我们在 https://github.com/microsoft/ToolTalk 发布 ToolTalk。

关键词

引用

@article{arxiv.2311.10775,
  title  = {ToolTalk: Evaluating Tool-Usage in a Conversational Setting},
  author = {Nicholas Farn and Richard Shin},
  journal= {arXiv preprint arXiv:2311.10775},
  year   = {2023}
}

备注

10 pages, 1 figure, ICLR 2024 Submission, https://github.com/microsoft/ToolTalk