中文

OpenCodeReasoning-II:通过自我批判实现简单测试时间尺度扩展

计算与语言 2025-07-15 v1

摘要

近期针对基于推理的大型语言模型(LLM),特别是其通过测试时间尺度所带来的潜力,为代码生成和批判蒸馏创造了重要机会。然而,两者的进展基本依赖于大规模高质量数据集。本文引入OpenCodeReasoning-II,该数据集包含250万个问答-解决方案-批判三元组(约35000个唯一编程问题),几乎是前最大公开可用代码推理数据集的两倍。在本文中,我们采用两阶段监督微调策略。第一个阶段侧重于代码生成的微调,第二个阶段则涉及代码生成与批判模型的联合训练。我们得到的微调Qwen2.5-Instruct模型在代码生成方面的性能要么超过,要么等于最佳的前开源蒸馏模型。值得注意的是,代码生成和批判模型的集成在竞赛编程性能方面带来了显著提升。此外,我们present了LiveCodeBench基准测试的一个扩展,以特别支持C++编程语言,从而促进了更全面的LLM评估。

关键词

引用

@article{arxiv.2507.09075,
  title  = {OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique},
  author = {Wasi Uddin Ahmad and Somshubra Majumdar and Aleksander Ficek and Sean Narenthiran and Mehrzad Samadi and Jocelyn Huang and Siddhartha Jain and Vahid Noroozi and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2507.09075},
  year   = {2025}
}

备注

work in progress