中文

不仅在哪里,更在什么时候:RLVR的时间调度

机器学习 2026-05-26 v1

摘要

基于可验证奖励的强化学习(RLVR)已成为大型语言模型(LLM)后训练的核心技术。虽然策略优化是基于全局广播标量奖励对所有采样 token进行驱动,但沿轨迹展现的异构策略行为在没有差异化的情况下被大大低估。现有工作通过信用分配来解决该问题,包括token级优势重新加权和选择性token优化,但分配准则在训练期间是基本静止的,限制了韧性的策略演化。在本工作中,我们认为学习信号何时被调度对token分布的重要性与“在哪里”分配相当。我们引入时间维度,将信用分配准则在RLVR优化过程中进行调度。我们发现,优先处理特定策略行为突出的目标token,逐渐向一般优化衰减,有助于实现更稳定和更高效的学习动力学。此外,我们表明简单轨迹百分位为区分策略行为提供了自然视角,并与时间调度有效集成。我们的分析揭示,标准优化在同时容纳异构行为时显著牺牲策略熵,而时间调度则产生更健康的策略演化动力学。在数学和一般推理基准上进行实验,表明时间调度在持续改进方面具有一致优势,表明其是优化的一个有前景的维度。

关键词

引用

@article{arxiv.2605.25381,
  title  = {Not only where, But when: Temporal Scheduling for RLVR},
  author = {Jinghao Zhang and Ruilin Li and Feng Zhao and Jiaqi Wang},
  journal= {arXiv preprint arXiv:2605.25381},
  year   = {2026}
}

备注

Github: https://github.com/Jinghaoleven/RLVR-Schedule