中文

SWE-bench:语言模型能否解决真实世界的 GitHub 问题?

计算与语言 2024-11-13 v3 人工智能 软件工程

摘要

语言模型的发展速度已超越我们有效评估它们的能力,但为其未来发展考虑,研究其能力前沿至关重要。我们发现真实世界的软件工程是评估下一代语言模型的一个丰富、可持续且具挑战性的测试平台。为此,我们提出 SWE-bench,一个由来自 12 个流行 Python 仓库的真实 GitHub 问题及对应拉取请求中抽取的 2,294 个软件工程问题组成的评估框架。给定一个代码库及待解决问题描述,语言模型需编辑该代码库以解决问题。解决 SWE-bench 中的问题经常需要同时理解和协调多个函数、类乃至文件间的改动,要求模型与执行环境交互、处理极长上下文并执行远超传统代码生成任务的复杂推理。我们的评估表明,最先进的专有模型和我们的微调模型 SWE-Llama 都只能解决最简单的问题。表现最佳的模型 Claude 2 仅能解决 1.96% 的问题。在 SWE-bench 上的进展代表着朝向更实用、更智能和更自主的语言模型迈出的步伐。

关键词

引用

@article{arxiv.2310.06770,
  title  = {SWE-bench: Can Language Models Resolve Real-World GitHub Issues?},
  author = {Carlos E. Jimenez and John Yang and Alexander Wettig and Shunyu Yao and Kexin Pei and Ofir Press and Karthik Narasimhan},
  journal= {arXiv preprint arXiv:2310.06770},
  year   = {2024}
}

备注

Data, code, and leaderboard are available at https://www.swebench.com ICLR 2024, https://openreview.net/forum?id=VTF8yNQM66