中文

AppBench:面向复杂用户指令从多个 APP 的多个 API 规划

软件工程 2024-10-29 v1 人工智能

摘要

大型语言模型(LLM)通过连接多种外部 API 与实际世界交互,实现更好的问题解决和任务自动化能力。以往研究主要聚焦于来自单一来源、参数有限的 API,或忽视不同 API 之间的复杂依赖关系。然而,尤其在处理复杂用户指令时,利用来自不同来源(例如来自 iPhone 的不同 App)的多个 API 进行协同式调用至关重要。本文介绍了\texttt{AppBench}——第一个用于评估 LLM 规划和执行来自多个来源的多个 API 以完成用户任务的基准测试。具体而言,我们关注多个 API 的两个重要挑战:\textit{1) 图结构:}某些 API 可独立执行,而另一些则需依次执行,导致类似图的执行顺序;\textit{2) 权限约束:}哪个来源被授权执行 API 调用。我们对9个不同的 LLM 进行了实验;例如,GPT-4o 在最复杂的指令上仅实现了2.0%的成功率,这表明即便在通过零样本学习和微调的帮助下,现有的前沿 LLM 在此类情形下仍表现不佳。我们的代码和数据已公开于https://github.com/ruleGreen/AppBench。

关键词

引用

@article{arxiv.2410.19743,
  title  = {AppBench: Planning of Multiple APIs from Various APPs for Complex User Instruction},
  author = {Hongru Wang and Rui Wang and Boyang Xue and Heming Xia and Jingtao Cao and Zeming Liu and Jeff Z. Pan and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2410.19743},
  year   = {2024}
}