中文

AgenTracer:谁在引发LLM智能体系统中的故障?

计算与语言 2025-09-05 v2 多智能体系统

摘要

基于大语言模型(LLM)的智能体系统通常由多个模型、复杂的工具调用和编排协议组成,其性能显著优于单体智能体。然而,这种复杂性也放大了它们的脆弱性,使其更容易发生系统故障。在长执行轨迹中定位导致错误的特定智能体或步骤,构成了智能体系统故障归因任务。然而,当前最先进的推理LLM在此挑战上表现明显不足,准确率通常低于10%。为解决这一差距,我们提出了AgenTracer,这是首个通过反事实重放和程序化故障注入来标注失败多智能体轨迹的自动化框架,并生成了精选数据集TracerTraj。利用该资源,我们开发了AgenTracer-8B,一种基于多粒度强化学习训练的轻量级故障追踪器,能够高效诊断冗长多智能体交互中的错误。在Who&When基准上,AgenTracer-8B的性能比Gemini-2.5-Pro和Claude-4-Sonnet等大型专有LLM高出高达18.18%,为LLM智能体故障归因树立了新标准。更重要的是,AgenTracer-8B为MetaGPT和MaAS等现成的多智能体系统提供了可操作的反馈,带来了4.8-14.2%的性能提升,赋能了自我纠正和自我进化的智能体AI。

关键词

引用

@article{arxiv.2509.03312,
  title  = {AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?},
  author = {Guibin Zhang and Junhao Wang and Junjie Chen and Wangchunshu Zhou and Kun Wang and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2509.03312},
  year   = {2025}
}