中文

何时开始扩散:基于低负载高杠杆的RLVR首词多样化

人工智能 2026-05-28 v1 计算与语言 机器学习

摘要

可验证奖励强化学习(RLVR)通过无标签轨迹训练推理模型,依赖分组轨迹暴露策略以获取替代推理路径,并利用验证器对其进行评分。因此,轨迹多样性已成为RLVR中的核心瓶颈,大多数现有方法通过温度、前缀或轨迹选择调整来扩大探索。我们识别了一个结构上区别且被忽视的位置,用于扩大这种多样性:推理标记后的第一个词。策略的首词分布呈现出高度集中的但与正确性解耦的现象,而该首词位置可以在不改变正确性信号的情况下扩大分组轨迹覆盖的区域。我们引入REFT(Rollout Exploration with First-Token Diversification),这是一条对RLVR管线的轻量级添加,通过从策略自身的top-N候选词中均匀采样首词并均匀分配轨迹,使其他所有组件保持不变。经过训练后的 diversified 轨迹,REFT在四个基模型(0.5B-7B)和三个难度等级上均显著提升了Pass@1、Pass@8和Pass@64指标,优于DAPO和GRPO基线方法。

关键词

引用

@article{arxiv.2605.28295,
  title  = {Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR},
  author = {Soeun Kim and Albert No},
  journal= {arXiv preprint arXiv:2605.28295},
  year   = {2026}
}