SWE-Mirror: 通过跨仓库镜像问题构建大规模问题解决数据集
软件工程
2025-09-11 v1
摘要
为大规模可验证的问题解决任务训练数据集的构建是一项关键但极具挑战性的任务。现有自动化真实世界问题的Gym环境配置方法成功率低且开销大。同时,在现有Gym环境中合成新任务则未能利用大量真实的人工报告问题。为最大化利用现有Gym环境以及GitHub上丰富的问题解决历史数据,我们提出了SWE-Mirror——一个流水线,它提取真实世界问题的语义本质,将其镜像到另一个配置了Gym环境的仓库中,并将其重新激活为可验证的问题解决任务。SWE-Mirror复用了现有Gym环境以及GitHub上托管的大量问题解决历史数据,构建了大规模的镜像真实且可验证任务数据集。将SWE-Mirror应用于4个语言下的40个仓库,我们整理了一个包含60,671个问题解决任务的数据集,并通过训练和评估不同规模的编码智能体展示了该数据集的价值。训练后实验表明,使用该数据集训练的模型在问题解决能力上有所提升。此外,通过将数据集规模扩展至超过12,000条高质量轨迹,我们在基于Qwen2.5-Coder-Instruct的LLM上建立了OpenHands智能体框架下的新最先进(SOTA)水平,使7B模型的SWE-Bench-Verified解决率提升21.8%,32B模型提升46.0%,验证了我们方法的有效性。
引用
@article{arxiv.2509.08724,
title = {SWE-Mirror: Scaling Issue-Resolving Datasets by Mirroring Issues Across Repositories},
author = {Junhao Wang and Daoguang Zan and Shulin Xin and Siyao Liu and Yurong Wu and Kai Shen},
journal= {arXiv preprint arXiv:2509.08724},
year = {2025}
}