中文

LiveCodeBench Pro:奥赛奖牌得主如何评估 LLM 在竞技编程中的表现?

软件工程 2025-06-16 v1 人工智能 计算与语言 机器学习

摘要

近期报告声称大语言模型(LLMs)在竞技编程中已超越顶尖人类。基于一组国际算法竞赛奖牌得主的专业知识,我们重新审视这一主张,考察 LLM 与人类专家之间的差异以及仍然存在的局限性。我们提出了 LiveCodeBench Pro,这是一个由 Codeforces、ICPC 和 IOI 的问题组成的基准测试,问题持续更新以降低数据污染的可能性。一支由奥赛奖牌得主组成的团队为每个问题标注算法类别,并对模型生成的失败提交逐行进行分析。利用这些新数据和基准测试,我们发现前沿模型仍存在显著局限性:在没有外部工具的情况下,最佳模型在中等难度问题上仅取得 53% 的 pass@1,在人类专家仍擅长的难题上取得 0%。我们还发现 LLM 在实现密集型问题上表现成功,但在微妙的算法推理和复杂案例分析方面存在困难,经常生成自信但错误的解释。高性能似乎主要由实现精度和工具增强驱动,而非更优越的推理能力。因此,LiveCodeBench Pro 凸显了与人类大师级别之间的显著差距,同时提供了细粒度的诊断工具,以指导以代码为中心的 LLM 推理的未来改进。

关键词

引用

@article{arxiv.2506.11928,
  title  = {LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?},
  author = {Zihan Zheng and Zerui Cheng and Zeyu Shen and Shang Zhou and Kaiyuan Liu and Hansen He and Dongruixuan Li and Stanley Wei and Hangyi Hao and Jianzhu Yao and Peiyao Sheng and Zixuan Wang and Wenhao Chai and Aleksandra Korolova and Peter Henderson and Sanjeev Arora and Pramod Viswanath and Jingbo Shang and Saining Xie},
  journal= {arXiv preprint arXiv:2506.11928},
  year   = {2025}
}

备注

Project Page at https://livecodebenchpro.com/