SABER:小动作,大错误——守护 LLM 智能体中的变异步骤
机器学习
2025-12-10 v1 人工智能
摘要
尽管 LLM 智能体进展迅速,但在长周期、使用工具的任务上,其表现依然脆弱。为了更好地理解这种脆弱性,我们提出一个简单的问题:所有动作对失败的贡献是否均等?通过分析 τ-Bench(航空/零售)和 SWE-Bench Verified 上的执行轨迹,我们将轨迹分解为变异(改变环境的)步骤与非变异步骤,并形式化了“决定性偏差”——即最早导致成功翻转为失败的动作级分歧。逻辑回归分析表明,对于当前最先进的模型,变异动作中每增加一次偏差,在航空任务上成功几率降低高达 92%,在零售任务上降低高达 96%。相比之下,非变异动作中的偏差几乎没有影响。随着上下文长度增加,代理偏离角色并根据过时约束采取行动,错误也随之增长。受这些观察启发,我们提出了 SABER,一种与模型无关、无需梯度、在测试时生效的防护机制,它 (i) 增加了变异门控验证,(ii) 在变异步骤前注入“定向反思”,(iii) 执行基于块的上下文清理。SABER 带来了一致的性能提升,例如,Qwen3-Thinking:在航空任务上相对提升 +28%,零售任务上 +11%,SWE-Bench Verified 上 +7%;Claude:+9%/+7%。我们进一步识别了 τ-Bench 中的天花板效应,即标注错误和任务规格不足人为限制了模型性能。为解决此问题,我们发布了 τ-Bench Verified,通过有针对性的修订恢复了基准的上升空间。我们的结果表明,动作级分析、定向保障和可靠的评估是构建稳健多轮代理的先决条件。
引用
@article{arxiv.2512.07850,
title = {SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents},
author = {Alejandro Cuadron and Pengfei Yu and Yang Liu and Arpit Gupta},
journal= {arXiv preprint arXiv:2512.07850},
year = {2025}
}
备注
submitted to ICLR2026