中文

思路优先,代码在后:在评估用于竞赛编程的 LLM 时将问题求解与代码生成解耦

计算与语言 2026-01-19 v1

摘要

大型语言模型(LLMs)在竞赛编程问题上日益取得成功,然而现有的评估将算法推理与代码级实现混为一谈。我们认为竞赛编程从根本上说是一项问题求解任务,并建议在解答生成和评估中都以自然语言题解为中心。在编写代码之前先生成题解可以提高某些 LLMs 的解题率,而在使用专家编写的标准题解时,提升幅度则显著更大。然而,即使有了标准题解,模型在实现方面仍然存在困难,而生成的题解与标准题解之间的差距揭示了在指定正确且完整的算法时持续存在的问题求解瓶颈。除了通过/失败指标外,我们通过使用专家注释将模型生成的题解与标准答案进行比较来诊断推理错误,并验证了用于可扩展评估的 LLM-as-a-judge 协议。我们引入了一个包含 83 道带有标准题解和完整测试套件的 ICPC 风格问题的数据集,并评估了 19 个 LLMs,主张未来的基准测试应明确将问题求解与实现分离开来。

关键词

引用

@article{arxiv.2601.11332,
  title  = {Idea First, Code Later: Disentangling Problem Solving from Code Generation in Evaluating LLMs for Competitive Programming},
  author = {Sama Hadhoud and Alaa Elsetohy and Frederikus Hudi and Jan Christian Blaise Cruz and Steven Halim and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2601.11332},
  year   = {2026}
}