SOP-Bench:用于评估 LLM 智能体的复杂工业标准操作程序
人工智能
2026-02-24 v2
摘要
基于 LLM 的智能体在执行工业自动化中基础的复杂、多步标准操作程序(SOPs)时面临困难。现有基准未能捕捉真实世界工作流的程序复杂性和工具编排需求。我们引入了 SOP-Bench,这是一个包含来自 12 个业务领域(医疗保健、物流、金融、内容审核等)由人类专家撰写的 SOP 的 2000 多个任务的基准。使用人机协作框架,专家制作了真实的 SOP,而 AI 生成了工件(工具、API、数据集),所有内容均经人工验证,从而产生了具有可执行界面和真实输出的现实任务。SOP-Bench 作为一项研究赋能工具,用于系统性地研究跨不同程序任务的智能体架构、模型能力和部署考量。我们通过对前沿模型子集在 Function-Calling(FC)和 ReAct 智能体上的说明性实验展示了其实用性,揭示了关键见解。例如,(1)较新的模型并不保证更好的性能——Claude 4 系列在 ReAct 任务上优于 Claude 4.5 系列(Claude 4 Opus:72.4% vs. Claude 4.5 Sonnet:63.3% 任务成功率),表明生产升级需要验证;(2)没有单一模型-智能体组合占据绝对优势:最佳性能因领域而异,从 57% 到 100% 不等。这些示例说明了 SOP-Bench 如何能够在无需昂贵生产实验的情况下,分离并研究智能体性能的特定维度。我们的目标不是对模型能力进行排名或构建最优智能体,而是提供一个严谨的评估框架,使研究人员和从业者能够系统地研究智能体设计选择、模型选择和部署策略。我们在 https://github.com/amazon-science/sop-bench 发布了该基准。
引用
@article{arxiv.2506.08119,
title = {SOP-Bench: Complex Industrial SOPs for Evaluating LLM Agents},
author = {Subhrangshu Nandi and Arghya Datta and Rohith Nama and Udita Patel and Nikhil Vichare and Indranil Bhattacharya and Prince Grover and Shivam Asija and Giuseppe Carenini and Wei Zhang and Arushi Gupta and Sreyoshi Bhaduri and Jing Xu and Huzefa Raja and Shayan Ray and Aaron Chan and Esther Xu Fei and Gaoyuan Du and Zuhaib Akhtar and Harshita Asnani and Weian Chan and Ming Xiong and Francesco Carbone and Jeetu Mirchandani},
journal= {arXiv preprint arXiv:2506.08119},
year = {2026}
}
备注
Under review