中文

CausalFlow:面向大语言模型智能体失败的因果归因与反事实修复

机器学习 2026-05-26 v1 人工智能

摘要

大语言模型智能体在涉及推理、工具使用和环境交互的多步骤任务中经常失败。虽然此类失败通常被记录或通过启发式方法重试,但它们包含了关于执行在何处中断的结构化信号。我们引入CausalFlow,一个干预框架,它将失败的智能体轨迹转换为最小的反事实修复和可重用的监督。CausalFlow将执行轨迹建模为依赖步骤的顺序链,并通过步骤级反事实干预计算因果责任分数,以识别导致失败的步骤。对于这些步骤,我们生成最小编辑的修复,将最终结果翻转为成功,产生经过验证的对比对。CausalFlow支持两种互补用途:目标测试时修复,以最小的行为漂移从失败中恢复;以及适用于离线偏好优化或奖励建模的训练时监督。在涵盖数学推理、代码生成、问答和医学浏览的四个基准测试中,CausalFlow将失败执行转换为经过验证的最小修复,具有高最小性和因果一致性分数,并证明因果归因对于跨不同智能体任务的可靠改进是必要的,在复杂的检索设置中优于启发式改进,同时在整个过程中产生更局部的修复。这些结果表明,对结构化执行轨迹进行干预分析提供了一种原则性且可扩展的机制,用于将智能体失败转化为可靠性提升和可学习的监督。

关键词

引用

@article{arxiv.2605.25338,
  title  = {CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures},
  author = {Akash Bonagiri and Devang Borkar and Gerard Janno Anderias and Setareh Rafatirad and Houman Homayoun},
  journal= {arXiv preprint arXiv:2605.25338},
  year   = {2026}
}