中文

ReflexGrad:基于进度门控双过程路由的 LLM 代理单元回放失败恢复

机器学习 2026-05-29 v4 人工智能

摘要

我们提出 ReflexGrad,这是一种无需演示样本的 LLM 代理单元在单元回放期间进行失败恢复的双过程架构。当代理早期提交错误方法并耗尽步骤预算时,事后失败的轨迹中包含逃出的线索——但目前没有任何已发布的架构能在单个单元回话中处理这些信息。ReflexGrad 在每隔 k=3k{=}3 步进行 TextGrad 风格的连续细化(快速过程),以及在 m=5m{=}5 连续低进度得分触发路由门时进行 Reflexion 风格的因果诊断(慢速过程)。确定性优先合并保持自然语言策略的连贯性,每次慢速激活会产生三个可观测产物:可复现的触发器、因果诊断和已验证的修复。实验表明,在 ALFWorld 134 个任务上(n=10n{=}10 个随机种子,无演示样本),ReflexGrad 将 Qwen-3-8B 的准确率从 35.1%35.1\% 提升至 75.4%75.4\%(提升 40.340.3 个百分点),超越计算匹配的 1-shot LATS 提升 2.72.7 个百分点(p0.01p{\approx}0.01),超越 ToT 提升 5.75.7 个百分点(p<104p{<}10^{-4}),超越 Self-Refine 提升 6.76.7 个百分点(p<105p{<}10^{-5});在 GPT-5 上提升幅度为 46.388.1%46.3{\to}88.1\%(提升 41.841.8 个百分点)。1.51.5 个百分点的跨模型差异在随机种子噪声范围内(p0.13p{\approx}0.13),表明路由机制而非模型规模是主要性能提升来源。我们发布了代码、提示语、每个随机种子的日志以及灵敏度扫描结果。

关键词

引用

@article{arxiv.2511.14584,
  title  = {ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing},
  author = {Ankush Kadu and Aswanth Krishnan},
  journal= {arXiv preprint arXiv:2511.14584},
  year   = {2026}
}

备注

18 pages, 4 figures, 10 tables. Accepted at ICML 2026 FoGen Workshop