LLM 编码能否战胜研究生 CS 学生?基于市场驱动的战略规划中的 LLM 与人类编码比赛
机器学习
2025-11-26 v1 人工智能
多智能体系统
摘要
大型语言模型 (LLM) 的快速普及彻底改变了 AI 辅助代码生成的方式。这种 LLM 的快速发展已超过我们对其进行恰当基准测试的能力。现有的基准测试侧重于单元测试通过率和语法正确性。这些指标低估了许多需要规划、优化和战略交互的现实问题的难度。我们引入了一个基于多智能体推理驱动的基准测试,基于一个真实世界的物流优化问题(拍卖、 pickup 和交付问题),该问题将竞争性拍卖与容量受限路由相结合。该基准测试要求构建能够(i)在不确定性下进行战略性投标,以及(ii)在最大化利润的同时优化交付任务的规划器。我们评估了 40 个由广泛使用的多种提示方法(包括 vibe coding)下的多种最先进 LLM 生成的智能体,以及 17 个在 LLM 出现之前由人类开发的智能体。在 12 场双向全对战比赛和约 4 万 场比赛中,我们的结果表明:(i)人类(研究生学生)编码的智能体显著优于 LLM 编码的智能体:前 5 名总是被人类编码的智能体占据;(ii)大多数 LLM 编码的智能体(其中 33 个)被非常简单的基线方法击败;(iii)即使在给定最佳人类解作为输入并被提示改进的情况下,表现最好的 LLM 也会使解决方案变差而不是改进。我们的结果凸显了 LLM 在实际场景中产生可竞争代码的能力之间的差距,并激励对强调推理驱动代码合成的新型评估。
引用
@article{arxiv.2511.20613,
title = {Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning},
author = {Panayiotis Danassis and Naman Goel},
journal= {arXiv preprint arXiv:2511.20613},
year = {2025}
}