中文

CodeElo:基于人类可比较 Elo 评分的 LLM 竞赛级代码生成基准测试

计算与语言 2025-01-06 v2

摘要

随着现有大型语言模型(LLM)代码推理能力的提升,以及来自 OpenAI o1 和 o3 等推理模型的突破,迫切需要开发更具挑战性和全面性的基准测试,以有效测试它们的 sophisticated 竞赛级编码能力。现有的基准测试,如 LiveCodeBench 和 USACO,由于缺乏私人测试用例、不支持特殊评判器以及执行环境不匹配等问题,未能满足需求。为填补这一差距,我们介绍 CodeElo,这是一个首次有效解决上述所有挑战的标准化竞赛级代码生成基准测试。CodeElo 基准主要基于官方 CodeForces 平台,力求与其尽可能接近。我们收集了最近六个月在 CodeForces 上举办的比赛题目,包含详细信息,如赛事 divisions、问题难度评级和问题算法标签。我们引入一种独特的评判方法,即直接将问题提交到该平台,并开发了一个与该平台一致且可与人类参赛者比较但波动性更低的可靠的 Elo 评分计算系统。通过在我们的 CodeElo 上进行测试,我们首次为 30 个流行的开源和 3 个专有 LLM 提供 Elo 评分。结果显示,o1-mini 和 QwQ-32B-Preview 分别取得了 1578 和 1261 的 Elo 评分,其他模型即使在最简单的问题上也难以克服,位于所有人类参赛者的最低 25% 中。还进行了详细的分析实验,以提供算法性能和 C++ 与 Python 比较的见解,这可以为未来研究提供方向。

关键词

引用

@article{arxiv.2501.01257,
  title  = {CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings},
  author = {Shanghaoran Quan and Jiaxi Yang and Bowen Yu and Bo Zheng and Dayiheng Liu and An Yang and Xuancheng Ren and Bofei Gao and Yibo Miao and Yunlong Feng and Zekun Wang and Jian Yang and Zeyu Cui and Yang Fan and Yichang Zhang and Binyuan Hui and Junyang Lin},
  journal= {arXiv preprint arXiv:2501.01257},
  year   = {2025}
}