中文

从 $P(y|x)$ 到 $P(y)$:探索预训练空间中的强化学习

机器学习 2026-04-16 v1 人工智能 计算与语言

摘要

虽然基于可验证奖励的强化学习(RLVR)通过优化条件分布 P(y|x) 显著提升了大语言模型的推理能力,但其潜力 fundamentally 受限于基础模型已有的输出分布。优化预训练空间中的边缘分布 P(y) 可解决这一瓶颈,通过编码推理能力并保持广泛的探索容量。然而,传统预训练依赖静态语料库进行被动学习,导致分布迁移,阻碍针对性推理增强。本文引入 PreRL(Pre-train Space RL),直接对 P(y) 应用奖励驱动的在线更新。我们在理论和实证上验证了 log P(y) 与 log P(y|x) 之间的强梯度对齐,确立 PreRL 是标准 RL 的可行替代方案。进一步我们发现,PreRL 中的负样本强化(NSR)是推理中极为有效的驱动因素。NSR-PreRL 快速修剪错误的推理空间,激发内在的反思行为,使转换和反思思维分别增加 14.89 倍和 6.54 倍。基于这些洞见,我们提出 Dual Space RL(DSRL),一种策略重生策略,通过 NSR-PreRL 初始化模型以扩大推理视野,再过渡到标准 RL 进行精细优化。广泛实验表明,DSRL 在所有强基线上均表现出色,证明了预训练空间修剪有效引导策略走向精炼的正确推理子空间。

关键词

引用

@article{arxiv.2604.14142,
  title  = {From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space},
  author = {Yuqiao Tan and Minzheng Wang and Bo Liu and Zichen Liu and Tian Liang and Shizhu He and Jun Zhao and Kang Liu},
  journal= {arXiv preprint arXiv:2604.14142},
  year   = {2026}
}

备注

Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR