PuzzleClone:一个基于领域特定语言驱动的可验证数据合成框架
人工智能
2026-05-29 v3
摘要
具有可验证答案的高质量数学和逻辑数据集对于增强大型语言模型(LLMs)的推理能力至关重要。尽管近期的数据增强技术促进了大规模基准的创建,但现有的 LLM 生成的数据集通常在可靠性、多样性和可扩展性方面存在不足。为应对这些挑战,我们引入了 PuzzleClone,这是一个利用新颖的领域特定语言(DSL)驱动方法大规模合成可验证数据的形式化框架。我们的方法包含三个关键创新:(1)将种子谜题编码为结构化的逻辑规范,(2)通过系统化的变量和约束随机化生成可扩展的变体,以及(3)通过再现机制确保有效性。应用 PuzzleClone,我们构建了 PC-83K,一个包含超过 83,000 个多样化且经过程序验证的谜题的基准数据集。生成的谜题涵盖了广泛的难度和格式,对当前最先进的模型构成了重大挑战。实验结果表明,在 PC-83K 上进行后训练(SFT 和 RL)不仅在测试集上带来了显著提升,而且在各种逻辑和数学基准测试中也取得了进步。后训练将 PC-83K 上的平均性能从 14.5 提升至 66.0,并在 7 个逻辑和数学基准测试中实现了高达 18.4 个绝对百分点的持续改进(SATBench 从 51.6 提升至 70.0)。我们的代码和数据可在 https://github.com/HiThink-Research/PuzzleClone 获取。
引用
@article{arxiv.2508.15180,
title = {PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data},
author = {Kai Xiong and Yanwei Huang and Rongjunchen Zhang and Kun Chen and Haipang Wu and Yingcai Wu},
journal= {arXiv preprint arXiv:2508.15180},
year = {2026}
}