SWE-rebench:面向软件工程智能体的任务收集自动化流水线与去污染评估
软件工程
2025-11-05 v2 计算与语言
摘要
基于 LLM 的智能体在日益增多的软件工程(SWE)任务中展现出了有前景的能力。然而,推进该领域面临两个关键挑战。首先,高质量的训练数据稀缺,尤其是反映真实世界 SWE 场景的数据,在这些场景中,智能体必须与开发环境交互、执行代码并根据其行为结果调整行为。现有数据集要么局限于一次性代码生成,要么包含小规模、人工策划的交互式任务集合,缺乏规模和多样性。其次,缺乏新鲜的交互式 SWE 任务影响了快速改进模型的评估,因为静态基准由于污染问题很快就会过时。为了解决这些局限性,我们引入了一种新颖的、自动化的且可扩展的流水线,以从多样的 GitHub 存储库中持续提取真实世界的交互式 SWE 任务。使用此流水线,我们构建了 SWE-rebench,这是一个包含超过 21,000 个交互式基于 Python 的 SWE 任务的公开数据集,适合大规模 SWE 智能体的强化学习。此外,我们使用 SWE-rebench 方法收集的持续供应的新鲜任务,为智能体软件工程构建了一个无污染的基准。我们在该基准上比较了各种 LLM 的结果与 SWE-bench Verified 上的结果,并表明某些语言模型的性能可能因污染问题而被夸大。
引用
@article{arxiv.2505.20411,
title = {SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents},
author = {Ibragim Badertdinov and Alexander Golubev and Maksim Nekrashevich and Anton Shevtsov and Simon Karasik and Andrei Andriushchenko and Maria Trofimova and Daria Litvintseva and Boris Yangel},
journal= {arXiv preprint arXiv:2505.20411},
year = {2025}
}
备注
Dataset: https://huggingface.co/datasets/nebius/SWE-rebench, SWE-rebench leaderboard https://swe-rebench.com NeurIPS 2025