ReflexGrad:基于进度门控双过程路由的 LLM 代理单元回放失败恢复
机器学习
2026-05-29 v4 人工智能
摘要
我们提出 ReflexGrad,这是一种无需演示样本的 LLM 代理单元在单元回放期间进行失败恢复的双过程架构。当代理早期提交错误方法并耗尽步骤预算时,事后失败的轨迹中包含逃出的线索——但目前没有任何已发布的架构能在单个单元回话中处理这些信息。ReflexGrad 在每隔 步进行 TextGrad 风格的连续细化(快速过程),以及在 连续低进度得分触发路由门时进行 Reflexion 风格的因果诊断(慢速过程)。确定性优先合并保持自然语言策略的连贯性,每次慢速激活会产生三个可观测产物:可复现的触发器、因果诊断和已验证的修复。实验表明,在 ALFWorld 134 个任务上( 个随机种子,无演示样本),ReflexGrad 将 Qwen-3-8B 的准确率从 提升至 (提升 个百分点),超越计算匹配的 1-shot LATS 提升 个百分点(),超越 ToT 提升 个百分点(),超越 Self-Refine 提升 个百分点();在 GPT-5 上提升幅度为 (提升 个百分点)。 个百分点的跨模型差异在随机种子噪声范围内(),表明路由机制而非模型规模是主要性能提升来源。我们发布了代码、提示语、每个随机种子的日志以及灵敏度扫描结果。
引用
@article{arxiv.2511.14584,
title = {ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing},
author = {Ankush Kadu and Aswanth Krishnan},
journal= {arXiv preprint arXiv:2511.14584},
year = {2026}
}
备注
18 pages, 4 figures, 10 tables. Accepted at ICML 2026 FoGen Workshop