中文

AI 自由职业者能否竞争?对收入、可靠性和规模化任务成功率的基准测试

人工智能 2025-05-21 v1 计算与语言 机器学习

摘要

本研究探讨了大型语言模型(LLM)作为用于实际任务的自主代理,例如自由职业软件开发。本工作提出了新的基准测试,对LLMs在源自经济数据的自由职业编程和数据分析任务上进行评估。我们构建基准测试所使用的合成任务来自Kaggle自由职业者数据集,其中的工作职位已标准化为美元(中位数固定项目价格约为250美元,平均为306美元)。每个任务都伴随结构化的输入输出测试案例和估计价格标签,使自动化正确性检查和货币化绩效评估成为可能。这一方法受到OpenAI最近SWELancer基准测试的启发(该基准测试包含1,400个真实的Upwork任务,总价值约100万美元)。尽管如此,我们的框架仍简化了评估,使用可程序化测试的任务和预测价格值,使其高度可扩展且可重复。本基准测试中,我们评估了四个现代LLM——Claude 3.5 Haiku、GPT-4o-mini、Qwen 2.5和Mistral。我们报告每个模型的准确率(任务成功率和测试案例通过率)以及其实现的总“自由职业收入”(已解决任务价格之和)。我们的结果显示,Claude 3.5 Haiku表现最佳,实现约152万美元收入,随后GPT-4o-mini紧随其后,为149万美元,Qwen 2.5为133万美元,Mistral为70万美元。我们分析了每个任务中错误的分布,观察到最强模型解决了最多的任务,并且几乎不会在任何项目上完全失败。我们讨论了这些结果对AI作为自由职业开发者的可行性、我们自动化基准测试方法的优势和局限性,以及在结构化任务上的表现与真实复杂自由职业工作之间的差距。

关键词

引用

@article{arxiv.2505.13511,
  title  = {Can AI Freelancers Compete? Benchmarking Earnings, Reliability, and Task Success at Scale},
  author = {David Noever and Forrest McKee},
  journal= {arXiv preprint arXiv:2505.13511},
  year   = {2025}
}