开源推理模型缺失的一块:缓解强化学习中短 CoT LLM 冷启动问题的数据集
计算与语言
2025-06-04 v1
摘要
随着公开可用的大型推理模型 (LRM) R1 的发布,研究人员通常通过在 R1 的长思维链 (CoT) 推理上训练语言模型来训练新的 LRM。尽管先前的工作表明 LRM 的能力可以通过直接蒸馏复现,但持续依赖现有模型(例如 R1)仍然是推动该领域发展的关键限制。作为迈向独立开发 LRM 的第一步,本文探讨了使用未经推理时缩放训练的 LLM 构建长 CoT 数据集的可能性。为此,我们提出了 Long CoT Collection,这是一个包含 10 万条 CoT 理据的数据集,使用现有的短 CoT LLM 进行标注。我们开发了一个流程,将 o1 的新颖推理策略引入短 CoT LLM,使其能够进行更长时间的思考,并引入对思维预算的可控性,以更好地管理过度思考问题。我们广泛的分析验证了我们的数据集质量与 R1 相当或略低。此外,我们的实验表明,在我们的数据集上进行训练不仅增强了通用推理能力,而且为强化学习提供了坚实的基础——在我们的数据上初始化的模型在 RLVR 中获得了 2-3 倍更大的收益。
引用
@article{arxiv.2506.02338,
title = {One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL},
author = {Hyungjoo Chae and Dongjin Kang and Jihyuk Kim and Beong-woo Kwak and Sunghyun Park and Haeju Park and Jinyoung Yeo and Moontae Lee and Kyungjae Lee},
journal= {arXiv preprint arXiv:2506.02338},
year = {2025}
}
备注
ACL 2025 Industry