SWE-Lancer:前沿大语言模型能否从真实世界的自由职业软件工程中赚到 100 万美元?
机器学习
2025-06-02 v4 软件工程
摘要
我们介绍了 SWE-Lancer,这是一个包含超过 1,400 个来自 Upwork 的自由职业软件工程任务的基准数据集,总价值达 100 万美元。SWE-Lancer 包含独立工程任务——从 50 美元的 bug 修复到 32,000 美元的功能实现——以及管理类任务,模型需在技术实现方案之间做出选择。独立任务通过经验丰富的软件工程师三重验证的端到端测试进行评分,而管理类决策则根据原始雇佣工程经理的选择进行评估。我们对模型性能进行了评估,发现前沿模型仍无法解决大多数任务。为促进未来研究,我们开源了一个统一的 Docker 镜像和公共评估划分,SWE-Lancer Diamond(https://github.com/openai/SWELancer-Benchmark)。通过将模型性能映射到货币价值,我们希望 SWE-Lancer 能促进对 AI 模型开发经济影响的更深入研究。
引用
@article{arxiv.2502.12115,
title = {SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?},
author = {Samuel Miserendino and Michele Wang and Tejal Patwardhan and Johannes Heidecke},
journal= {arXiv preprint arXiv:2502.12115},
year = {2025}
}
备注
9 pages, 30 pages appendix