中文

LiveOIBench:大型语言模型能否在信息素操场赛事中超越人类选手?

人工智能 2025-12-23 v2 计算与语言 机器学习

摘要

竞争编程问题日益成为评估大型语言模型(LLM)编程能力的宝贵基准,因其复杂性和易于验证。然而,当前的编码基准面临诸多限制,如缺乏极具挑战性的问题、测试用例覆盖不足、依赖在线平台 API 限制可及性等。为此,我们引入 LiveOIBench,一个包含403个经专家精选的奥林匹克级竞争编程问题的综合性基准,每个问题平均包含60个专家设计的测试用例。问题来源于2023至2025年间来自14个不同地区的官方竞技赛事。LiveOIBench 通过四个关键特征实现领先:(1)严挑挑选高质量任务,包含详细子任务评分标准和大量私有测试用例;(2)直接整合顶尖选手表现数据,实现对顶尖人类的有意义比较;(3)计划持续、无污染地更新新近发布的奥林匹克问题;(4)自包含的评估系统便于离线和易于复现。对34个流行的通用型和推理型 LLM 进行基准测试,我们发现 GPT-5 达到了显著的81.76百分位,虽为强劲成果,但仍不及顶尖人类选手(通常位于90百分位以上)。相比之下,在开源权重推理模型中,GPT-OSS-120B 仅达60百分位,凸显了前沿封闭模型与之之间的显著能力差异。详细分析表明,稳健的推理模型倾向于优先进行精确的问题分析而非过度探索,表明未来模型应强调结构化分析并最小化不必要的探索。所有数据、代码和排行榜结果均公开于我们的网站。

关键词

引用

@article{arxiv.2510.09595,
  title  = {LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?},
  author = {Kaijian Zou and Aaron Xiong and Yunxiang Zhang and Frederick Zhang and Yueqi Ren and Jirong Yang and Ayoung Lee and Shitanshu Bhushan and Lu Wang},
  journal= {arXiv preprint arXiv:2510.09595},
  year   = {2025}
}