RepoGenesis:从 Readme 到仓库的端到端微服务生成基准
软件工程
2026-04-16 v3
摘要
大型语言模型和智能体在代码生成方面取得了显著进展。然而,现有基准侧重于单一函数/类级别的生成(如 ClassEval)或对现有代码库的修改(如 SWE-Bench),忽略了反映真实世界 0 到 1 开发工作流程的完整微服务仓库生成。为填补这一差距,我们引入 RepoGenesis,这是第一个面向仓库级别端到端 Web 微服务生成的多语言基准,包含 106 个仓库(60 个 Python,46 个 Java),覆盖 18 个领域和 11 个框架,包含 1,258 个 API 端点和 2,335 个经通过“审查-反驳”质量保证流程验证的测试用例。我们评估了开源智能体(如 DeepCode)和商业集成开发环境(如 Cursor),使用 Pass@1、API 覆盖率 (AC) 和部署成功率 (DSR) 进行评估。结果显示,尽管最佳系统在 AC(最高达 73.91%)和 DSR(最高达 100%)方面表现优异,但其在 Python 上的 Pass@1 仅为 23.67%,在 Java 上仅为 21.45%,暴露了在架构一致性、依赖管理和跨文件一致性方面的不足。值得注意的是,针对 RepoGenesis(训练集)微调的 GenesisAgent-8B 性能可与 GPT-5 mini 相媲美,证明了 RepoGenesis 在推动微服务生成方面的质量。我们在 https://github.com/pzy2000/RepoGenesis 上发布了本基准。
引用
@article{arxiv.2601.13943,
title = {RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository},
author = {Zhiyuan Peng and Xin Yin and Pu Zhao and Fangkai Yang and Lu Wang and Ran Jia and Xu Chen and Qingwei Lin and Saravan Rajmohan and Dongmei Zhang},
journal= {arXiv preprint arXiv:2601.13943},
year = {2026}
}