高效的多回合 LLM Agent 训练
交换代数
2025-11-21 v1
摘要
我们介绍 SkyRL-Agent,一个用于高效、多回合、长期程度 agent 训练和评估的框架。它提供了高效的异步调度、轻量级工具集成和灵活的后端互操作性,使其能够无缝集成现有 RL 框架,如 SkyRL-train、VeRL 和 Tinker。通过 SkyRL-Agent,我们训练了 SA-SWE-32B,这是一个仅使用强化学习从 Qwen3-32B 训练的软件工程 agent。我们引入了两个关键组件:一个优化的异步管线调度器,相较于朴素异步批处理实现 的加速,以及一个利用 AST 基搜索工具的工具增强训练配方,以促进代码导航、提升 rollout Pass@K 并提高训练效率。尽管仅在 SWE 任务上训练,SA-SWE-32B 仍能有效泛化到其他 agentic 任务,包括 Terminal-Bench、BrowseComp-Plus 和 WebArena。我们进一步通过在深度研究、计算机使用和记忆 agent 上的案例研究,展示了 SkyRL-Agent 的可扩展性,这些任务分别使用不同的训练后端实现。
引用
@article{arxiv.2511.16109,
title = {Obstructions to curvature of modules over Cohen-Macaulay rings},
author = {Tony J. Puthenpurakal},
journal= {arXiv preprint arXiv:2511.16109},
year = {2025}
}
备注
Comments welcome