中文

R1-Zero 的"顿悟时刻"在非 SFT 2B 模型上的视觉推理

人工智能 2025-03-11 v2 计算机视觉与模式识别 机器学习

摘要

最近,DeepSeek R1 展示了如何通过基于简单规则的强化学习激励,使大型语言模型自主发展复杂推理能力,其特征是"顿悟时刻"——模型在训练过程中表现出自我反思并增加响应长度。然而,将这一成功扩展到多模态推理的尝试往往未能复现这些关键特征。在本报告中,我们首次成功地在仅使用非 SFT 的 2B 模型上复现了这些多模态推理的涌现特征。以 Qwen2-VL-2B 为起点,直接在 SAT 数据集上应用强化学习,我们的模型在 CVBench 上达到了 59.47% 的准确率,比基线模型提升了约 30%,并超过了 SFT 设置约 2%。此外,我们分享了在使用 RL 训练指令模型以实现 R1 类推理时的失败尝试和见解,旨在阐明其中面临的挑战。我们的关键观察包括:(1)在指令模型上应用 RL 往往导致平凡的推理轨迹,(2)朴素的长度奖励无法有效激发推理能力。项目代码可在 https://github.com/turningpoint-ai/VisualThinker-R1-Zero 获取。

关键词

引用

@article{arxiv.2503.05132,
  title  = {R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model},
  author = {Hengguang Zhou and Xirui Li and Ruochen Wang and Minhao Cheng and Tianyi Zhou and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:2503.05132},
  year   = {2025}
}

备注

10 pages, 6 figures