RedStar:扩大长链思维数据是否解锁更好的慢推理系统?
摘要
扩大规模是否可以转化为推理能力?本文探索了将长链思维(Long-CoT)数据扩展至 1000k 样本以开发慢思考模型 RedStar 的潜力。通过对 various LLMs 和不同规模的实验,我们发现 Long-CoT 训练的专业化和规模配伍的关键要素。令人惊讶的是,even smaller models 在有限数据下也显示出显著的性能提升,揭示了 Long-CoT 的样本效率以及样本难度在学习过程中的关键作用。我们的发现表明,仅需少量几千个示例即可有效触发 Long-CoT 推理,而大型模型则实现了卓越的改进。我们还引入了强化学习(RL)规模训练作为推进慢思考系统的有前景的方向。RedStar 在多个领域表现突出:在 MATH-Hard 基准测试中,RedStar-code-math 的性能从 66.2% 提升至 81.6%;在美国数学奥林匹克(AIME),仅使用 21k 混合 code-math 数据集即可解决 46.7% 的问题。在多模态任务如 GeoQA 和 MathVista-GEO 中,RedStar-Geo 仅凭有限的 Long-CoT 数据即可取得具竞争力的结果,超越了其他慢思考系统如 QvQ-Preview。与 QwQ 相比,RedStar 在推理和通用性之间取得了完美的平衡。我们的工作表明,通过 careful tuning,扩大 Long-CoT 数据集即可解锁惊人的推理能力——即便数据集有限,也为各种挑战设定了慢思考模型的新标准。我们的数据和模型已发布于 https://huggingface.co/RedStar-Reasoning。
引用
@article{arxiv.2501.11284,
title = {RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?},
author = {Haotian Xu and Xing Wu and Weinong Wang and Zhongzhi Li and Da Zheng and Boyuan Chen and Yi Hu and Shijia Kang and Jiaming Ji and Yingying Zhang and Zhijiang Guo and Yaodong Yang and Muhan Zhang and Debing Zhang},
journal= {arXiv preprint arXiv:2501.11284},
year = {2025}
}
备注
technique-report, https://huggingface.co/RedStar-Reasoning