中文

SWE-TRACE:通过评分制流程奖励模型和启发式测试时扩展优化长期 SWE 代理

软件工程 2026-04-17 v1

摘要

使用自主代理解决实际软件工程 (SWE) 问题需要复杂的长期推理。当前管道受限于未优化的演示数据、稀疏执行奖励和计算昂贵的推理扩展,导致 token 膨胀、奖励攻击和策略退化。我们提出 SWE-TRACE(Trajectory Reduction and Agentic Criteria Evaluation),一个统一框架优化 SWE 代理生命周期中的数据精选、强化学习和测试时推理。首先,我们引入一种 LLM 多任务级联方法,利用 stepwise oracle verification 从而提炼出严格偏向 token 高效、最短路径轨迹的 60K 实例监督微调 (SFT) 语料库。其次,为克服稀疏结果奖励的不稳定性,我们设计了具备记忆功能的代理 RL 流水线,特点是基于评分的过程奖励模型 (PRM)。一个辅助评分代理提供稠密、细粒度的中间步骤反馈,引导模型完成长期任务。最后,我们将 PRM 用于启发式引导的测试时扩展 (TTS),通过动态评估和修剪每个步骤的动作候选,SWE-TRACE 在搜索效率上取得优势,无需标准并行抽样的延迟开销。在标准 SWE 基准上进行的大量实验表明,SWE-TRACE 在显著减少 token 消耗和推理延迟的同时,显著推动了最新进展,最大化问题解决率。

关键词

引用

@article{arxiv.2604.14820,
  title  = {SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling},
  author = {Hao Han and Jin Xie and Xuehao Ma and Weiquan Zhu and Ziyao Zhang and ZhiLiang Long and Hongkai Chen and Qingwen Ye},
  journal= {arXiv preprint arXiv:2604.14820},
  year   = {2026}
}