中文

解读 R1-Zero 类训练:一个批判性视角

机器学习 2025-10-07 v2 人工智能 计算与语言

摘要

DeepSeek-R1-Zero 表明,强化学习(RL)可在无监督微调的情况下直接提升大语言模型(LLM)的推理能力。本文通过分析其两个核心组件:基础模型和 RL,批判性地考察 R1-Zero 类训练。我们检验了广泛的基础模型,包括 DeepSeek-V3-Base,以了解预训练特征如何影响 RL 性能。我们的分析表明,DeepSeek-V3-Base 已表现出“Aha 时刻”,而 Qwen2.5 基础模型即使无需提示模板即可展现出强大的推理能力,暗示了潜在的预训练偏差。此外,我们识别了组相对策略优化(GRPO)中的一种优化偏差,该偏差在训练期间人为增加响应长度(尤其是针对错误输出)。为此,我们引入 Dr. GRPO—a 一种无偏优化方法,提高了 token 效率,同时保持推理性能。基于这些见解,我们提出了一种极简主义的 R1-Zero 配方,使用 7B 基础模型即可在 AIME 2024上取得 43.3% 的准确率,达成新的 SOTA。我们的代码可在 https://github.com/sail-sg/understand-r1-zero 查看。

关键词

引用

@article{arxiv.2503.20783,
  title  = {Understanding R1-Zero-Like Training: A Critical Perspective},
  author = {Zichen Liu and Changyu Chen and Wenjun Li and Penghui Qi and Tianyu Pang and Chao Du and Wee Sun Lee and Min Lin},
  journal= {arXiv preprint arXiv:2503.20783},
  year   = {2025}
}