中文

长期 LLM 智能体中的定量目标持久性测量与强制

机器学习 2026-05-25 v1 软件工程

摘要

长期语言智能体可以进行大量合理的局部工具调用,却无法持续到请求的计数实际完成。我们将这一差距研究为定量目标持久性(QGP):即智能体是否持续工作,直到外部验证器确认足够的 distinct 有效项目。PushBench 将其转化为一个用于存储库-工件收集和验证器支持工作单元的基准,使得重复工作、重复提交、虚假完成和进度漂移直接测量,而非隐藏在最终成功标志之后。在匹配的控制器比较中,状态跟踪检索控制器达到 69-78% 的成功率,消除了重复提交;而工作单元控制器跟踪控制器在标准和完成门控控制器完成无任务实例的setting中达到 25-50% 的成功率。黑箱前沿智能体评估显示,Claude Code(Sonnet 4.6)和 Codex CLI(gpt-5.4)在解决 50 项工件任务时表现良好,但在 100 项工件时成功数降至每条件仅 3 项。结果表明,定量目标对智能体的可靠性要求与本地任务能力要求不同:智能体必须维护已验证的进度,仅在请求工作完成时才停止。

关键词

引用

@article{arxiv.2605.23574,
  title  = {Push Your Agent: Measuring and Enforcing Quantitative Goal Persistence in Long-Horizon LLM Agents},
  author = {Yuandao Cai and Yuzhang Zhu and Liyou Gao and Wensheng Tang and Shengchao Qin},
  journal= {arXiv preprint arXiv:2605.23574},
  year   = {2026}
}