中文

基准测试中藏有什么?——关于 SWE-Bench 自动化程序修复的论述

软件工程 2026-02-05 v1

摘要

自动化程序修复(Automated Program Repair,APR)的快速进展得益于人工智能的突破,尤其是大型语言模型(LLMs)和基于智能体的系统。SWE-Bench 是一个旨在使用来自流行开源 Python 仓库中挖掘的真实问题来评估修复系统的基准测试。其公开排行榜——SWE-Bench Lite 和 Verified——已成为跟踪进展、比较解决方案的核心平台。本文present了对这两个排行榜的首次全面研究,考察了提交解答者、提交方背后的产品、所使用的 LLMs 以及方法的开放性。我们分析了提交至 Lite 排行榜的 79 条记录和 Verified 排行榜的 133 条记录。我们的结果表明,两个排行榜上的大多数提交来自行业,尤其是小型公司和大型上市公司。这些提交往往取得顶尖成绩,尽管学术贡献——通常是开源的——也保持竞争力。我们还发现专有 LLMs 主导地位,尤其是 Claude 系列产品,在两个排行榜上实现最佳成绩的 currently 由 Claude 4 Sonnet 完成。这些发现为 SWE-Bench 生态系统提供了洞见,可指导未来基准驱动研究实现更大的透明度和多样性。

关键词

引用

@article{arxiv.2602.04449,
  title  = {What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair},
  author = {Matias Martinez and Xavier Franch},
  journal= {arXiv preprint arXiv:2602.04449},
  year   = {2026}
}

备注

Accepted in 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP'26). https://doi.org/10.1145/3786583.3786904