多智能体 LLM 系统为何会失败?
人工智能
2025-10-28 v3
摘要
尽管对多智能体 LLM 系统(MAS)抱有浓厚期待,但其在流行基准测试上的性能提升往往微乎其微。这一差距凸显了对 MAS 为何会失败进行系统性理解的迫切需求。解决此问题需要系统性地识别和分析失败模式。我们引入 MAST-Data,这是一个覆盖 7 个主流 MAS 框架、包含 1600 多条带注释轨迹的综合数据集。MAST-Data 是首个揭示 MAS 失败动态的多智能体系统数据集,旨在为未来更好系统的开发指明方向。为实现对 MAST-Data 失败的系统性分类,我们构建了首个多智能体系统失败分类法(MAST)。我们通过对 150 条轨迹进行严格分析,紧密依据专家人工注释者指导,并通过高一致性验证(kappa=0.88),识别出 14 种独特模式,归类为三大类别:(i)系统设计问题、(ii)智能体间不一致、(iii)任务验证。为实现可扩展的标注,我们开发了一个与人工标注高度一致的 LLM 作为评判官管道。我们利用 MAST 和 MAST-Data 对模型(GPT-4、Claude 3、Qwen2.5、CodeLlama)和任务(编码、数学、通用智能体)中的失败模式进行分析,展示了通过更佳 MAS 设计所带来的提升空间。我们的分析揭示了所识别的失败需要更为复杂的解决方案,凸显了未来研究的明确路线图。我们公开发布了这套全面数据集(MAST-Data)、MAST 分类法以及我们的 LLM 评判官,以促进 MAS 领域的广泛研究与开发。
引用
@article{arxiv.2503.13657,
title = {Why Do Multi-Agent LLM Systems Fail?},
author = {Mert Cemri and Melissa Z. Pan and Shuyi Yang and Lakshya A. Agrawal and Bhavya Chopra and Rishabh Tiwari and Kurt Keutzer and Aditya Parameswaran and Dan Klein and Kannan Ramchandran and Matei Zaharia and Joseph E. Gonzalez and Ion Stoica},
journal= {arXiv preprint arXiv:2503.13657},
year = {2025}
}
备注
ArXiv v3