中文

AI 智能体的整体评估与故障诊断

人工智能 2026-05-15 v1 计算与语言

摘要

AI 智能体执行复杂的多步过程,但当前的评估存在不足:结果指标仅报告成功或失败而未解释原因,而过程级方法难以在长而结构化的轨迹中将故障类型与其精确位置联系起来。我们提出了一个整体的智能体评估框架,将自顶向下的智能体级诊断与自底向上的片段级评估相结合,将分析分解为独立的逐片段评估。这种分解可扩展至任意长度的轨迹,并为每个判定生成片段级理由。在 TRAIL 基准测试上,我们的框架在 GAIA 和 SWE-Bench 的所有指标上均取得了 SOTA 结果,相对于最强先前基线,类别 F1 的相对增益高达 38%,定位准确率高达 3.5 倍,联合定位-分类准确率高达 12.5 倍。逐类别分析表明,我们的框架在比任何其他评估器更多的错误类别中处于领先。值得注意的是,同一个前沿模型在我们的框架内使用时,其定位准确率比作为整个轨迹的单体评判器高出数倍,这表明评估方法而非模型能力才是瓶颈。

关键词

引用

@article{arxiv.2605.14865,
  title  = {Holistic Evaluation and Failure Diagnosis of AI Agents},
  author = {Netta Madvil and Gilad Dym and Alon Mecilati and Edo Dekel and Jonatan Liberman and Rotem Brazilay and Liron Schliesser and Max Svidlo and Shai Nir and Orel Shalom and Yaron Friedman and David Connack and Amos Rimon and Philip Tannor and Shir Chorev},
  journal= {arXiv preprint arXiv:2605.14865},
  year   = {2026}
}