PretrainZero:强化学习主动预训练
计算与语言
2025-12-04 v1
摘要
模仿人类行为,通过从一般经验中主动学习以实现通用人工智能,一直是人类的梦想。近期基于强化学习(RL)的大思维模型展示了令人印象深刻的专家级能力,即软件和数学,但仍严重依赖特定领域内可验证的奖励,这成为扩展通用推理能力性能边界的重大瓶颈。在这项工作中,我们提出了 PretrainZero,一个基于预训练语料库构建的强化学习主动学习框架,将 RL 从领域特定的后训练扩展到通用预训练。PretrainZero 具备以下特征:1)主动预训练:受人类主动学习能力的启发,PretrainZero 学习统一的推理策略,主动从预训练语料库中识别合理且信息丰富的内容,并通过 RL 进行推理预测。2)自监督学习:在没有任何可验证标签、预训练奖励模型或监督微调的情况下,我们直接使用 RL 从 3 到 30B 基础模型在通用 Wikipedia 语料库上预训练推理器,显著突破了通用推理的验证数据瓶颈。3)验证扩展:通过处理日益困难的掩码片段,PretrainZero 大幅增强了预训练基础模型的通用推理能力。在强化预训练中,PretrainZero 在 MMLU-Pro、SuperGPQA 和数学平均基准上分别将 Qwen3-4B-Base 提升了 8.43、5.96 和 10.60。在后训练中,预训练模型也可作为下游 RLVR 任务的推理基础模型。
引用
@article{arxiv.2512.03442,
title = {PretrainZero: Reinforcement Active Pretraining},
author = {Xingrun Xing and Zhiyuan Fan and Jie Lou and Guoqi Li and Jiajun Zhang and Debing Zhang},
journal= {arXiv preprint arXiv:2512.03442},
year = {2025}
}