SwingArena:面向长上下文 GitHub Issue 解决的竞技编程评测场
计算与语言
2026-03-10 v3
摘要
我们提出了 SwingArena,这是一个面向大语言模型(LLM)的竞技评估框架,其紧密模拟了真实世界的软件开发工作流。与传统的静态基准不同,SwingArena 通过将 LLM 配对为提交者(生成补丁)和审查者(创建测试用例并通过持续集成(CI)流水线验证补丁),对软件迭代的协作过程进行了建模。为了支持这些交互式评估,我们引入了一个检索增强代码生成(RACG)模块,该模块通过从大型代码库中提供语法和语义相关的代码片段,高效处理长上下文挑战,并支持多种编程语言(C++、Python、Rust 和 Go)。这使得该框架能够跨越多样的任务和上下文进行扩展,同时遵守 token 限制。我们的实验使用了从 2,300 个 issue 中选出的 400 多个高质量真实 GitHub issue,结果表明 GPT-4o 等模型擅长激进的补丁生成,而 DeepSeek 和 Gemini 则在 CI 验证中优先考虑正确性。SwingArena 提出了一种可扩展且可延伸的方法,用于在真实的、CI 驱动的软件开发环境中评估 LLM。更多详情请访问我们的项目页面:swing-bench.github.io
引用
@article{arxiv.2505.23932,
title = {SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving},
author = {Wendong Xu and Jing Xiong and Chenyang Zhao and Qiujiang Chen and Haoran Wang and Hui Shen and Zhongwei Wan and Jianbo Dai and Taiqiang Wu and He Xiao and Chaofan Tao and Z. Morley Mao and Ying Sheng and Zhijiang Guo and Hongxia Yang and Bei Yu and Lingpeng Kong and Quanquan Gu and Ngai Wong},
journal= {arXiv preprint arXiv:2505.23932},
year = {2026}
}
备注
The paper has been accepted as an oral presentation at ICLR 2026