SOP-Maze:评估大型语言模型在复杂商业标准作业程序中的能力
计算与语言
2026-01-15 v2
摘要
随着大型语言模型 (LLM) 被广泛部署作为特定领域的智能体,已提出许多基准来评估其遵循指令和在现实场景中做出决策的能力。然而,商业场景常涉及复杂的标准作业程序 (SOP),且尚未充分探讨 LLM 在此类上下文中的能力。为填补这一差距,我们提出了 SOP-Maze,一个由真实商业数据构建并适应为 397 个实例和 3422 个子任务的基准,这些数据来自 23 种复杂 SOP 场景。我们进一步将 SOP 任务分为两大类:Lateral Root System (LRS),代表需要精确选择的宽选项任务;以及 Heart Root System (HRS),强调在复杂分支中进行深层逻辑推理。广泛的实验结果揭示,几乎所有最先进的模型在 SOP-Maze 上都表现不佳。我们进行了全面分析,识别出三个关键错误类别:(i) 路径盲区:难以遵循程序;(ii) 对话脆弱性:无法处理真实对话细微差别;(iii) 计算错误:在复杂情境下进行时间或算术推理时的错误。该系统性研究探索了 LLM 在既挑战广度又挑战深度的 SOP 任务中的性能,为改进模型能力提供了新见解。我们已开源本项目:https://github.com/meituan-longcat/SOP-Maze。
引用
@article{arxiv.2510.08942,
title = {SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures},
author = {Jiaming Wang and Zhe Tang and Zehao Jin and Hefei Chen and Yilin Jin and Peng Ding and Xiaoyu Li and Xuezhi Cao},
journal= {arXiv preprint arXiv:2510.08942},
year = {2026}
}