中文

智能体失败:基于自动标注的 LLM 智能体 bug 全面研究

软件工程 2026-04-28 v2

摘要

大型语言模型 (LLM) 已彻底革新了智能应用程序的开发。尽管独立的 LLM 无法执行任何操作,但 LLM 智能体通过集成工具来解决这一限制。然而,由于该领域仍处于早期阶段,社区发展不足,调试 LLM 智能体在成本和难度上都很高。为了理解智能体开发过程中遇到的 bug 类型、根本原因及其影响,我们present 对基于 LLM 智能体的软件中 bug 类型、根本原因和影响的第一次全面研究。我们收集并分析了来自 Stack Overflow、GitHub 和 Hugging Face 论坛的 1,187 条与 bug 相关的帖子和代码片段,聚焦于使用七个广泛使用的 LLM 框架以及自定义实现的 LLM 智能体。为了进行更深入的分析,我们还研究了发生 bug 的组件,以及编程语言和框架。该研究还调查了自动识别 bug 的可行性。为此,我们构建了一个名为 BugReAct 的 ReAct 智能体,配备足够的外部工具来确定它是否能够检测并标注我们数据集中的 bug。根据我们的研究发现,配备 Gemini 2.5 Flash 的 BugReAct 在标注 bug 特征方面取得了惊人的性能,平均每个帖子/代码片段的成本仅为 0.01 美元。

关键词

引用

@article{arxiv.2601.15232,
  title  = {When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling},
  author = {Niful Islam and Ragib Shahriar Ayon and Deepak George Thomas and Shibbir Ahmed and Mohammad Wardat},
  journal= {arXiv preprint arXiv:2601.15232},
  year   = {2026}
}