RepoForge: 利用端到端数据整理流程协同SFT与RL规模化训练SOTA快速思考型SWE智能体
软件工程
2025-09-04 v2
摘要
训练软件工程(SWE)大语言模型(LLM)受到昂贵基础设施、低效评估流程、稀缺训练数据和昂贵质量控制等因素的制约。我们提出了RepoForge,一个自主的、端到端的流程,能够规模化地生成、评估和训练SWE智能体。我们的主要贡献包括:(1) RepoForge-8B-Agent,在SWE-Bench-Verified上达到17.4%的准确率,为≤8B非思考型LLM树立了新的最先进水平;(2) 从真实GitHub提交自动生成了7,304个可执行环境,无需人工干预;(3) 通过智能依赖管理和镜像剪枝,实现了14倍的存储缩减(每个实例从1.4GB降至102MB);(4) 使用基于Ray的分布式RepoForge工具链,评估速度提升超过70%;(5) 通过我们自动化的SPICE难度评估技术,标注成本降低了19,000倍。通过统一存储高效的沙箱、基于Ray的评估工具链、自动化数据生成、基于SPICE的标注和无气泡RL框架,我们证明了即使是≤8B的模型也能在SWE-Bench-Verified等要求严苛的基准上达到新的最先进性能。我们的方法解决了SWE智能体训练中的关键瓶颈:基于容器的评估的高存储成本、低效的顺序奖励流程、高质量训练数据的稀缺性、昂贵的人工标注以及多轮RL流程的瓶颈。
引用
@article{arxiv.2508.01550,
title = {RepoForge: Training a SOTA Fast-thinking SWE Agent with an End-to-End Data Curation Pipeline Synergizing SFT and RL at Scale},
author = {Zhilong Chen and Chengzong Zhao and Boyuan Chen and Dayi Lin and Yihao Chen and Arthur Leung and Gopi Krishnan Rajbahadur and Gustavo A. Oliva and Haoxiang Zhang and Aaditya Bhatia and Chong Chun Yong and Ahmed E. Hassan},
journal= {arXiv preprint arXiv:2508.01550},
year = {2025}
}