ReMiT:基于 RL 的中期训练,用于迭代 LLM 演化
计算与语言
2026-02-04 v1
摘要
大型语言模型 (LLM) 的标准训练管道通常是单向的,从 pre-training 到 post-training 依次进行。然而,post-training 从后向 pre-trained 基础模型中获取见解的潜力尚未被探索。我们旨在建立一个自我强化的飞轮:一个循环,其中 RL 调整后的模型加强基础模型,进而提升后续 post-training 性能,无需专门训练的教师或参考模型。为实现这一目标,我们分析了训练动力学,确定 mid-training (annealing) 阶段是模型能力的关键转折点。这一阶段通常发生在 pre-training 结束时,利用高质量语料库并配合快速衰减的学习率。基于此洞察,我们引入了 ReMiT (Reinforcement Learning-Guided Mid-Training)。具体而言,ReMiT 利用 RL 调整后模型的推理先验在 mid-training 阶段动态地对 token 进行重新加权,优先选择对推理至关重要的 token。经验上,ReMiT 在 10 个 pre-training 基准上平均提高 3%,涵盖数学、代码和一般推理,并通过 2% 的提升持续维持这些收益。这些结果验证了迭代反馈环路,使 LLM 的持续自我演化成为可能。
引用
@article{arxiv.2602.03075,
title = {ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution},
author = {Junjie Huang and Jiarui Qin and Di Yin and Weiwen Liu and Yong Yu and Xing Sun and Weinan Zhang},
journal= {arXiv preprint arXiv:2602.03075},
year = {2026}
}
备注
25 pages