SWE-Factory: 用于问题解决训练数据和评估基准的自动化工厂
软件工程
2026-01-06 v3 人工智能
摘要
构建大规模GitHub问题解决数据集对于训练和评估大型语言模型(LLM)的软件工程能力至关重要。然而,现有的GitHub问题解决数据构建流程既复杂又劳动密集。我们识别出当前流程的三个关键局限:(1) 收集的测试补丁经常遗漏二进制文件变更;(2) 评估环境的手动构建劳动密集;(3) fail2pass验证阶段需要人工检查测试日志并编写自定义解析代码以从日志中提取测试状态。在本文中,我们提出了SWE-Factory,一个完全自动化的问题解决数据构建流程,以解决这些局限。首先,我们的流程自动恢复缺失的二进制测试文件并确保测试补丁的正确性。其次,我们引入了SWE-Builder,一个基于LLM的多智能体系统,用于自动化评估环境构建。第三,我们引入了一种标准化的基于退出码的日志解析方法,以自动提取测试状态,实现完全自动化的fail2pass验证。在四种编程语言上的671个真实GitHub问题上的实验表明,我们的方法能够以合理成本有效构建GitHub问题的有效评估环境。例如,使用GPT-4.1 mini,我们的SWE-Builder在671个问题中构建了337个有效任务实例,每个实例成本为0.047美元。我们的消融研究进一步展示了SWE-Builder不同组件的有效性。我们还通过人工检查证明,基于退出码的fail2pass验证方法具有很高的准确性,F1分数达到0.99。此外,我们进行了一项探索性实验,以研究是否可以利用SWE-Factory来增强模型的软件工程能力。
引用
@article{arxiv.2506.10954,
title = {SWE-Factory: Your Automated Factory for Issue Resolution Training Data and Evaluation Benchmarks},
author = {Lianghong Guo and Yanlin Wang and Caihua Li and Wei Tao and Pengyu Yang and Jiachi Chen and Haoyu Song and Duyu Tang and Zibin Zheng},
journal= {arXiv preprint arXiv:2506.10954},
year = {2026}
}
备注
To appear at FSE'2026