Skywork Open Reasoner 1 技术报告
机器学习
2025-05-30 v2 人工智能
计算与语言
摘要
DeepSeek-R1 的成功突显了强化学习(RL)在提升大型语言模型(LLM)推理能力方面的重要作用。在本工作中,我们提出了 Skywork-OR1,一种用于长思维链模型的有效且可扩展的 RL 实现。基于 DeepSeek-R1-Distill 模型系列,我们的 RL 方法取得了显著的性能提升,将 32B 模型在 AIME24、AIME25 和 LiveCodeBench 上的平均准确率从 57.8% 提升至 72.8%(+15.0%),将 7B 模型从 43.6% 提升至 57.5%(+13.9%)。我们的 Skywork-OR1-32B 模型在 AIME24 和 AIME25 基准测试上超越了 DeepSeek-R1 和 Qwen3-32B,同时在 LiveCodeBench 上取得了可比的结果。Skywork-OR1-7B 和 Skywork-OR1-Math-7B 模型在同等规模的模型中展示了有竞争力的推理能力。我们对训练流程的核心组件进行了全面的消融研究,以验证其有效性。此外,我们深入研究了熵崩溃现象,确定了影响熵动力学的关键因素,并证明了缓解过早的熵崩溃对于提升测试性能至关重要。为了支持社区研究,我们完全开源了我们的模型权重、训练代码和训练数据集。
引用
@article{arxiv.2505.22312,
title = {Skywork Open Reasoner 1 Technical Report},
author = {Jujie He and Jiacai Liu and Chris Yuhao Liu and Rui Yan and Chaojie Wang and Peng Cheng and Xiaoyu Zhang and Fuxiang Zhang and Jiacheng Xu and Wei Shen and Siyuan Li and Liang Zeng and Tianwen Wei and Cheng Cheng and Bo An and Yang Liu and Yahui Zhou},
journal= {arXiv preprint arXiv:2505.22312},
year = {2025}
}