中文

强化学习就够了

机器学习 2025-03-13 v1 计算与语言

摘要

受 DeepSeek R1 通过强化学习进行推理而无需人类反馈的成功启发,我们使用纯强化学习训练了一个 3B 语言模型,任务为 Countdown Game。我们的模型在五个基准中的四个上超越了基线,展示了超越训练数据的泛化能力。值得注意的是,响应长度与推理质量并不相关,虽然出现了"顿悟时刻",但它们并不总是产生正确答案。这些发现凸显了仅靠强化学习训练进行推理增强的潜力,并建议未来工作优化奖励结构以弥合涌现洞察与准确性之间的差距。

关键词

引用

@article{arxiv.2503.09512,
  title  = {Reinforcement Learning is all You Need},
  author = {Yongsheng Lian},
  journal= {arXiv preprint arXiv:2503.09512},
  year   = {2025}
}

备注

15 pages, 2 figures