中文

$V_{0.5}$:稀疏 RL 撰写的通用价值模型作为先验

机器学习 2026-03-12 v1 人工智能 计算与语言

摘要

在可验证奖励的强化学习(RLVR)中,构建稳健的优势基线对策略梯度至关重要,有效引导策略模型强化所需行为。近期研究引入了通用价值模型(如 V0V_0),通过显式地在上下文中编码模型能力,实现预训练的价值估计,从而无需同步更新价值模型和策略模型。在本文中,我们提出 V0.5V_{0.5},它自适应地融合了来自此类价值模型(作为先验)的基线预测与稀疏撰写中获得的经验均值。这构建了一个在计算效率与极低方差之间取得平衡的稳健基线。具体而言,我们引入实时统计检验和动态预算分配机制。在稀疏抽样导致的高方差与价值模型先验固有的系统性偏差(或幻觉)之间,V0.5V_{0.5} 通过构建假设检验来评估先验的可靠性,从而动态地在需要时分配额外的撰写预算。这种机制最小化基线估计器的均方误差(MSE),确保即使在样本量为 4 的极端稀疏情况下,策略梯度也能稳定。广泛的评估在六个数学推理基准上表明,V0.5V_{0.5} 在速度和收敛性方面显著优于 GRPO 和 DAPO,实现了超过约 10% 的性能提升。

关键词

引用

@article{arxiv.2603.10848,
  title  = {$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts},
  author = {Yi-Kai Zhang and Yueqing Sun and Hongyan Hao and Qi Gu and Xunliang Cai and De-Chuan Zhan and Han-Jia Ye},
  journal= {arXiv preprint arXiv:2603.10848},
  year   = {2026}
}