中文

语言模型能否解决奥林匹克编程问题?

计算与语言 2024-04-18 v1 人工智能 编程语言

摘要

计算类奥林匹克赛包含一些对人类而言极具挑战性的问题,要求复杂的算法推理、谜题解决,以及生成高效代码。然而,这一领域尚未被充分研究作为评估语言模型 (LM) 的基准。本文我们引入了美国计算奥林匹克 (USACO) 基准,包含 307 个来自美国计算奥林匹克的问题,附有高质量单元测试、参考代码以及每个问题的官方分析。这些资源使我们能够首次构建和测试 various LM 推理方法用于竞赛编程。我们发现 GPT-4 在零样本链律思考提示下仅实现 8.7% 的通过率@1,最佳推理方法通过结合自我反思和对 episodes 知识的检索,将其提升至 20.2%。然而,这仍远远不足以解决该基准。为更好地理解剩余挑战,我们设计了一种新型的人类在环研究,惊讶地发现,少数针对性提示即可使 GPT-4 在之前任何模型和方法无法解决的 13 个问题中解决 13 个问题。我们的基准、基线方法、定量结果和定性分析为 LMs 具备扎实、创造性和算法推理能力的初步步骤。

关键词

引用

@article{arxiv.2404.10952,
  title  = {Can Language Models Solve Olympiad Programming?},
  author = {Quan Shi and Michael Tang and Karthik Narasimhan and Shunyu Yao},
  journal= {arXiv preprint arXiv:2404.10952},
  year   = {2024}
}

备注

Code and data: https://princeton-nlp.github.io/USACOBench/