KodCode:一个多样化、具有挑战性且可验证的编程合成数据集
机器学习
2025-07-15 v2 人工智能
计算与语言
摘要
我们提出了 KodCode,一个合成数据集,旨在解决在训练面向编程的大型语言模型时,在多样化难度和领域中获取高质量、可验证训练数据的持久挑战。现有的编程资源通常无法确保覆盖面的广度(例如涵盖从简单编程任务到高级算法问题)或可验证的正确性(例如单元测试)。相比之下,KodCode 由通过自验证程序系统性地验证过的问题-解决方案-测试三元组组成。我们的流程首先合成广泛范围的编程问题,然后生成解决方案和测试用例,并为具有挑战性的问题分配额外的尝试次数。最后,通过将问题重写为多样化格式,并利用推理模型(DeepSeek R1)在基于测试的拒绝采样程序下生成响应,完成训练数据合成。该流程产生了一个大规模、稳健且多样化的编程数据集。KodCode 适用于监督微调,配对的单元测试也为强化学习调优提供了巨大潜力。在编程基准测试(HumanEval(+)、MBPP(+)、BigCodeBench 和 LiveCodeBench)上的微调实验表明,KodCode 微调的模型达到了最先进的性能,超越了 Qwen2.5-Coder-32B-Instruct 和 DeepSeek-R1-Distill-Llama-70B 等模型。
引用
@article{arxiv.2503.02951,
title = {KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding},
author = {Zhangchen Xu and Yang Liu and Yueqin Yin and Mingyuan Zhou and Radha Poovendran},
journal= {arXiv preprint arXiv:2503.02951},
year = {2025}
}
备注
Accepted by ACL 2025. Codes and Data: https://kodcode-ai.github.io/