SynLogic:大规模合成可验证推理数据以学习逻辑推理及更广泛能力
人工智能
2025-06-05 v4 计算与语言
摘要
诸如 OpenAI-o1 和 DeepSeek R1 等近期进展展示了强化学习(RL)在提升大型语言模型(LLMs)推理能力方面的潜力。尽管开源复现工作主要集中在数学和代码领域,但发展通用推理能力的方法与资源仍待深入探索。这一差距部分源于难以收集适合 RL 的多样且可验证的推理数据。我们假设逻辑推理对于发展通用推理能力至关重要,因为逻辑构成了推理的基础构建块。在这项工作中,我们提出了 SynLogic,一个数据合成框架和数据集,能够大规模生成涵盖 35 种不同逻辑推理任务的多样逻辑推理数据。SynLogic 方法允许对数据难度和数量进行可控合成。重要的是,所有样本均可由简单规则验证,使其非常适合带有可验证奖励的 RL。在实验中,我们基于 7B 和 32B 模型验证了在 SynLogic 数据集上进行 RL 训练的有效性。SynLogic 在开源数据集中实现了 SOTA 的逻辑推理性能,在 BBEH 上超越 DeepSeek-R1-Distill-Qwen-32B 6 个百分点。此外,将 SynLogic 数据与数学和代码任务混合,提高了这些领域的训练效率,并显著增强了推理泛化能力。值得注意的是,我们的混合训练模型在多个基准上优于 DeepSeek-R1-Zero-Qwen-32B。这些发现将 SynLogic 定位为推进 LLMs 更广泛推理能力的宝贵资源。我们在 https://github.com/MiniMax-AI/SynLogic 开源了数据合成流水线和 SynLogic 数据集。
引用
@article{arxiv.2505.19641,
title = {SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond},
author = {Junteng Liu and Yuanxiang Fan and Zhuo Jiang and Han Ding and Yongyi Hu and Chi Zhang and Yiqi Shi and Shitong Weng and Aili Chen and Shiqi Chen and Yunan Huang and Mozhi Zhang and Pengyu Zhao and Junjie Yan and Junxian He},
journal= {arXiv preprint arXiv:2505.19641},
year = {2025}
}