从强化学习到最大似然:基于有限 rollout 的 RL2ML 代理目标
机器学习
2026-05-29 v1
摘要
基于正确性的强化学习与可验证奖励 (RLVR) 使用二进制反馈训练语言模型,但优化的目标在期望值意义上与有限 rollout 组所诱导的随机更新几何常被混淆。本文发展了 RL2ML,一族具有闭式、恰好无偏梯度估计的有限 rollout 代理目标。该族连续地连接标准强化学习、类似最大似然的训练以及超越最大似然的目标,同时在固定 rollout 预算下保持估计器与目标之间的对齐。在本文中,我们引入组级更新规模来刻画 rollout 组在其经验成功计数被观察后如何被重新加权,揭示了在种群水平目标符号所隐藏的亚临界-超临界更新规模转变。建立在此区别基础上,校准的指标收益分析和精确方差分解表明,最佳代理目标的选择既不取决于与最大似然的接近程度,也不取决于种群水平权重alone。相反,它取决于评估指标、局部灵敏度和估计器方差的共同作用。代理目标族中剩余的自由度因此可以表述为一个一维优化问题,而不是被当作一个不受约束的超参数来处理。
引用
@article{arxiv.2605.30154,
title = {RL2ML: Finite-Rollout Surrogate Objectives from Reinforcement Learning to Maximum Likelihood},
author = {Yifu Zheng},
journal= {arXiv preprint arXiv:2605.30154},
year = {2026}
}