中文

CLEANER:自净化轨迹增强智能体强化学习

机器学习 2026-01-22 v1

摘要

智能体强化学习 (RL) 赋予了大型语言模型 (LLMs) 利用 Python 解释器等工具解决复杂问题的能力。然而,对于参数受限的模型(例如 4B--7B),探索阶段常受困于频繁的执行失败,产生噪声轨迹从而阻碍策略优化。在标准的基于结果的奖励设置下,这种噪声导致了关键的信用分配问题,即错误动作会随成功结果被无意强化。现有的缓解措施面临两难境地:密集奖励常引发奖励黑客行为,而超量采样则带来过高的计算成本。为应对这些挑战,我们提出了 CLEANER。与外部过滤方法不同,CLEANER 利用模型固有的自我纠错能力,在数据收集期间直接消除受错误污染的上下文。其核心在于相似性感知自适应回溯 (SAAR) 机制,该机制通过回顾性地用成功的自我纠错替换失败部分,自主构建干净、净化后的轨迹。基于语义相似度,SAAR 自适应地调节替换粒度,从浅层执行修复到深层推理替换。通过在这些自净化路径上训练,模型内化了正确的推理模式,而非错误恢复循环。在 AIME24/25、GPQA 和 LiveCodeBench 上的实证结果表明,相较于基线平均准确率分别提升了 6%、3% 和 5%。值得注意的是,CLEANER 仅使用三分之一的训练步数即达到了 SOTA 性能,凸显了轨迹净化作为高效智能体 RL 可扩展解决方案的潜力。我们的模型和代码可在 GitHub 获取。

关键词

引用

@article{arxiv.2601.15141,
  title  = {CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning},
  author = {Tianshi Xu and Yuteng Chen and Meng Li},
  journal= {arXiv preprint arXiv:2601.15141},
  year   = {2026}
}