RAFFLES:基于推理的 LLM 系统故障归因
人工智能
2026-02-02 v3 计算与语言
摘要
复杂、互联的长程 LLM 系统的出现,使得识别这些系统在何处以及何时发生故障变得极其棘手。现有的评估能力存在局限性,因为它们通常关注简单的指标、端到端结果,并且依赖于人类的视角。为了匹配这些多组件系统日益增加的复杂性,评估框架也必须能够推理、探查、迭代,并理解流经这些系统的细微逻辑。在本文中,我们提出了 RAFFLES,一种结合迭代推理的离线评估架构。具体而言,RAFFLES 作为一个迭代的多组件流水线运行,使用中央 Judge 系统地识别故障,并使用一组专门的 Evaluator 评估候选故障的质量以及 Judge 的依据。我们使用多个基准对 RAFFLES 进行了评估——用于识别多智能体系统中步骤级故障的 Who&When 数据集,以及用于诊断步骤级数学推理错误的 ReasonEval 数据集。RAFFLES 优于强基线,在 Who&When 人工制作和算法生成数据集上的准确率分别超过 20% 和 50%,在 ReasonEval 数据集上的准确率超过 80%。这些结果表明,在通过自动化故障检测替代劳动密集型人工审查以应用于自主系统方面迈出了关键一步。
引用
@article{arxiv.2509.06822,
title = {RAFFLES: Reasoning-based Attribution of Faults for LLM Systems},
author = {Chenyang Zhu and Spencer Hong and Jingyu Wu and Kushal Chawla and Charlotte Tang and Youbing Yin and Nathan Wolfe and Erin Babinsky and Daben Liu},
journal= {arXiv preprint arXiv:2509.06822},
year = {2026}
}
备注
Accepted at EACL 2026 Main Conference