中文

关于诱导和改进 R1 类推理模型的实证研究

计算与语言 2025-03-07 v1

摘要

本报告是 STILL 项目中慢思考模型开发的第三篇技术报告。随着技术路径逐渐清晰,扩展 RL 训练已成为实现此类推理模型的核心技术。我们系统地实验并记录了影响 RL 训练的各种因素,在基座模型和已微调模型上进行实验。具体而言,我们证明了我们的 RL 训练方法能够持续改进 Qwen2.5-32B 基座模型,提升响应长度和测试准确率。此外,我们表明即使像 DeepSeek-R1-Distill-Qwen-1.5B 这样的模型已经达到了较高的性能水平,通过 RL 训练仍可进一步精炼,使其在 AIME 2024 上达到 39.33% 的准确率。除 RL 训练外,我们还探索了工具操作的使用,发现其显著提升了大型推理模型的性能。该方法在 AIME 2024 上采用贪婪搜索实现了最高可达 86.67% 的准确率,凸显了其在提升模型能力方面的有效性。我们在 STILL 项目网站发布了我们的资源:https://github.com/RUCAIBox/Slow_Thinking_with_LLMs。

关键词

引用

@article{arxiv.2503.04548,
  title  = {An Empirical Study on Eliciting and Improving R1-like Reasoning Models},
  author = {Zhipeng Chen and Yingqian Min and Beichen Zhang and Jie Chen and Jinhao Jiang and Daixuan Cheng and Wayne Xin Zhao and Zheng Liu and Xu Miao and Yang Lu and Lei Fang and Zhongyuan Wang and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2503.04548},
  year   = {2025}
}

备注

Technical Report on Slow Thinking with LLMs: Part III