DRIVE:强化学习中可验证奖励的竞赛代码生成数据策展最佳实践
摘要
近期推出的 reasoning-first 模型(如 OpenAI o1、DeepSeek R1)已推动 RLVR 复潮。尽管如此,进展主要集中在数学领域(如 AIME),而竞赛编程代码生成仍属下游,数据策展受到较少关注。我们调查如何构建 RLVR 数据集(即 RL 提示),并提出实用训练技术,在竞赛编程代码生成方面取得优异成绩。我们的 pipeline 从来自强大开源模型的 SFT 开始,augmented with general-purpose and reasoning-intensive data。随后 RL 采用两个阶段过程,采用可执行、testcase-driven rewards:首先,在大规模均匀分布的竞赛编程问题集合上进行训练,使用 Group Relative Policy Optimization (GRPO) 进行 8 次 rollout 每个提示,采用相对较短的 response-generation window(如本阶段为 24k)以扩大 entropy 并缓解重复和截断;其次,我们进行 Pre-GRPO:在小规模高质量的挑战问题集合上进行更新,采用大规模 rollout 预算(每个提示 64 次 rollout),并采用 hard-focus curriculum 持续保留最具挑战性的实例。我们在 Qwen2.5-32B 上实现该方法,并在 LeetCode 和 Codeforces 每周赛中进行评估以避免数据泄漏。 resulting model 在相似规模的模型中实现了最新水平性能,与 DeepSeek v3.1 和 Doubao-1.5-Thinking 等领先系统相当。我们还检查了 scaling trends,观察到在内部大规模 MoE 模型上表现出强劲的 RL scaling。本研究提炼出 RLVR 在竞赛编程代码生成中数据策展、entropy expansion 和 curriculum design 的简明最佳实践。
引用
@article{arxiv.2511.06307,
title = {DRIVE: Data Curation Best Practices for Reinforcement Learning with Verifiable Reward in Competitive Code Generation},
author = {Speed Zhu and Jianwei Cai and Guang Chen and Lulu Wu and Saiyong Yang and Wiggin Zhou},
journal= {arXiv preprint arXiv:2511.06307},
year = {2025}
}
备注
15 pages, 8 figures