中文

RLP:强化学习作为预训练目标

机器学习 2026-03-03 v2 人工智能 计算与语言

摘要

训练大型推理模型的主导范式始于使用大量数据上的下一个词元预测损失进行预训练。强化学习虽然在扩展推理能力方面强大,但仅作为后训练的最后阶段引入,在监督微调之后。虽然占主导地位,但这是一种最优的训练方式吗?在本文中,我们提出了 RLP,一种信息驱动的强化预训练目标,将强化学习的核心精神——探索——引入预训练的最后阶段。核心思想是将思维链视为探索性动作,奖励根据其为预测未来词元所提供的信息增益来计算。该训练目标本质上鼓励模型在预测下一个词元之前独立思考,从而在预训练早期培养独立思考行为。更具体地说,奖励信号衡量在同时以上下文和采样推理链为条件时下一个词元的对数似然增加量,相比仅以上下文为条件的情况。这种方法产生了无需验证器的密集奖励信号,允许在预训练期间对整个文档流进行高效训练。具体而言,RLP 将推理的强化学习重新框定为普通文本上的预训练目标,弥合了下一个词元预测与有用思维链推理出现之间的差距。在 Qwen3-1.7B-Base 上使用 RLP 进行预训练,在八项基准数学与科学测试集上的总体平均提升了 19%。在相同后训练条件下,收益叠加,在 AIME25 和 MMLU-Pro 等重推理任务上提升最大。将 RLP 应用于 Nemotron-Nano-12B-v2 将总体平均从 42.81% 提升至 61.32%,科学推理平均提升 23%,展示了跨架构和模型规模的可扩展性。

关键词

引用

@article{arxiv.2510.01265,
  title  = {RLP: Reinforcement as a Pretraining Objective},
  author = {Ali Hatamizadeh and Syeda Nahida Akter and Shrimai Prabhumoye and Jan Kautz and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro and Yejin Choi},
  journal= {arXiv preprint arXiv:2510.01265},
  year   = {2026}
}

备注

ICLR 2026 camera ready