WorkflowLLM:增强大语言模型的工作流编排能力
软件工程
2024-11-11 v1 人工智能
计算与语言
摘要
近期大语言模型(LLM)的进展推动了流程自动化的革命性范式转变,从机器人流程自动化转向智能体流程自动化,通过基于LLM的自动化实现工作流编排过程。然而,现有的LLM(即使是先进的OpenAI GPT-4o)在工作流编排能力方面仍局限于取得令人满意的能力。为解决这一局限性,我们提出了WorkflowLLM,一个以数据为中心精心设计的框架,旨在增强LLM在工作流编排中的能力。它首先构建了一个大规模微调数据集WorkflowBench,包含106,763个样本,覆盖来自83个应用的1,503个API,横跨28个类别。具体构建过程可分为三个阶段:(1)数据收集:我们从Apple Shortcuts和RoutineHub收集真实工作流数据,将其转录为Python风格代码。我们进一步通过ChatGPT为其配备生成的分层思维。(2)查询扩展:我们提示ChatGPT生成更多任务查询以丰富工作流的多样性和复杂性。(3)工作流生成:我们利用在收集数据上训练的标注模型为合成查询生成工作流。最后,我们将通过质量验证的合成样本与收集的样本合并以获得WorkflowBench。基于WorkflowBench,我们对Llama-3.1-8B进行微调以获得WorkflowLlama。我们的实验表明,WorkflowLlama展现出编排复杂工作流的强大能力,同时在先前未见过的API上也取得了显著的泛化性能。此外,WorkflowBench在分布外的任务规划数据集T-Eval上展现出稳健的零样本泛化能力。我们的数据和代码可在https://github.com/OpenBMB/WorkflowLLM获取。
引用
@article{arxiv.2411.05451,
title = {WorkflowLLM: Enhancing Workflow Orchestration Capability of Large Language Models},
author = {Shengda Fan and Xin Cong and Yuepeng Fu and Zhong Zhang and Shuyan Zhang and Yuanwei Liu and Yesai Wu and Yankai Lin and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2411.05451},
year = {2024}
}