中文

DeepSeek-R1 发布 100 天后:关于复现研究与推理语言模型更多方向的综述

计算与语言 2025-05-16 v3

摘要

推理语言模型(RLM)的最新发展代表了大型语言模型的一次新演变。特别是,最近发布的 DeepSeek-R1 产生了广泛的社会影响,并激发了研究界对探索语言模型显式推理范式的热情。然而,已发布模型的实现细节尚未被 DeepSeek 完全开源,包括 DeepSeek-R1-Zero、DeepSeek-R1 和蒸馏的小模型。因此,出现了许多复现研究,旨在重现 DeepSeek-R1 所取得的强大性能,通过类似的训练过程和完全开源的数据资源达到了可比的性能。这些工作研究了监督微调(SFT)和可验证奖励强化学习(RLVR)的可行策略,重点关注数据准备和方法设计,产生了各种有价值的见解。在本报告中,我们对最近的复现研究进行了总结,以启发未来的研究。我们主要关注 SFT 和 RLVR 两个主要方向,介绍了当前复现研究在数据构建、方法设计和训练过程方面的细节。此外,我们总结了这些研究报告的实现细节和实验结果中的关键发现,期待能启发未来的研究。我们还讨论了增强 RLM 的其他技术,强调了扩大这些模型应用范围的潜力,并讨论了发展中的挑战。通过本综述,我们旨在帮助 RLM 的研究人员和开发者了解最新进展,并寻求启发新思路以进一步增强 RLM。

关键词

引用

@article{arxiv.2505.00551,
  title  = {100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models},
  author = {Chong Zhang and Yue Deng and Xiang Lin and Bin Wang and Dianwen Ng and Hai Ye and Xingxuan Li and Yao Xiao and Zhanfeng Mo and Qi Zhang and Lidong Bing},
  journal= {arXiv preprint arXiv:2505.00551},
  year   = {2025}
}