中文

从总结到行动:利用开放世界 API 增强大语言模型处理复杂任务的能力

人工智能 2024-02-29 v1 计算与语言 计算机视觉与模式识别

摘要

人类与动物的区别在于人类拥有使用和创造工具的独特能力。工具赋予人类克服生理局限的力量,促进了辉煌文明的创造。同样,赋予大语言模型(LLMs)等基础模型学习使用外部工具的能力,可能是实现通用人工智能的关键一步。该领域以往的研究主要追求两种截然不同的方法来增强 LLMs 的工具调用能力。第一种方法强调构建相关数据集用于模型微调。相比之下,第二种方法旨在通过上下文学习策略充分利用 LLMs 固有的推理能力。在本工作中,我们引入了一种新颖的工具调用流水线,旨在控制海量的现实世界 API。该流水线模拟了人类解决问题的过程,以处理复杂的现实生活用户查询。在每一步中,我们引导 LLMs 总结已取得的成果并确定下一步行动。我们将此流水线称为“从总结到行动”,简称 Sum2Act。在 ToolBench 基准测试上对 Sum2Act 流水线的实证评估显示,其性能显著提升,优于 ReAct 和 DFSDT 等既定方法。这突显了 Sum2Act 在增强 LLMs 处理复杂现实世界任务方面的有效性。

关键词

引用

@article{arxiv.2402.18157,
  title  = {From Summary to Action: Enhancing Large Language Models for Complex Tasks with Open World APIs},
  author = {Yulong Liu and Yunlong Yuan and Chunwei Wang and Jianhua Han and Yongqiang Ma and Li Zhang and Nanning Zheng and Hang Xu},
  journal= {arXiv preprint arXiv:2402.18157},
  year   = {2024}
}