中文

rStar-Coder:基于大规模验证数据集扩展竞争性代码推理

计算与语言 2025-05-28 v1

摘要

大语言模型(LLM)代码推理的进步从根本上受限于高难度数据集的稀缺,特别是那些包含可验证输入输出测试用例、用于大规模严格验证解决方案的数据集。我们引入了rStar-Coder,通过构建包含418K竞赛级代码问题、580K长推理解决方案以及不同难度丰富测试用例的大规模验证数据集,显著提升了LLM的代码推理能力。这通过三项核心贡献实现:(1)我们策划竞赛编程代码问题和标准解答以合成新的可解问题;(2)我们引入可靠的输入输出测试用例合成流水线,将生成分解为三步输入生成方法和用于有效输出标记的相互验证机制;(3)我们为问题扩充了经测试用例验证的高质量长推理解决方案。在Qwen模型(1.5B-14B)上跨各种代码推理基准的广泛实验证明了rStar-Coder数据集的优越性,以小得多的模型尺寸实现了与前沿推理LLM相当的领先性能。在LiveCodeBench上,rStar-Coder将Qwen2.5-7B从17.4%提升至令人瞩目的57.3%,将Qwen2.5-14B从23.3%提升至62.5%,超越o3-mini (low) 3.1%。在更具挑战性的美国计算机奥林匹克竞赛上,我们的7B模型实现了16.15%的平均pass@1准确率,优于前沿级QWQ-32B。代码和数据集将发布于 https://github.com/microsoft/rStar。

关键词

引用

@article{arxiv.2505.21297,
  title  = {rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset},
  author = {Yifei Liu and Li Lyna Zhang and Yi Zhu and Bingcheng Dong and Xudong Zhou and Ning Shang and Fan Yang and Mao Yang},
  journal= {arXiv preprint arXiv:2505.21297},
  year   = {2025}
}