中文

稳定知识,促进推理:基于双 token 约束的 RLVR

计算与语言 2026-05-18 v2

摘要

强化学习可验证奖励 (RLVR) 已成为提高大型语言模型 (LLM) 推理能力的有效后训练方法。然而,现有方法主要在所有 token 上应用统一的优化约束,忽略了其异构角色。先前的工作表明,高熵 token 与推理密切相关,而低熵 token 主要编码事实知识,最近的研究尝试通过遮蔽或异步训练来利用这一区别。我们认为,这种隔离会破坏自回归生成的序列依赖结构,导致学习次优。为此,我们提出了一种基于熵感知的 RLVR 框架 **Archer**,采用 **双 token 约束** 以保留联合优化,同时在不同 token 类型之间调制更新强度。该方法引入响应级熵归一化,以实现稳定的 token 分类,并对推理 token 应用不同的裁剪范围和 KL 正则化,以鼓励探索,同时保留知识 token。在数学推理和代码生成基准测试中进行实验,表明 Archer 在多个模型规模下均优于强基线,提升了 \textit{pass@1} 和 \textit{pass@K} 性能。这些结果凸显了在为 LLM 设计细粒度 RL 优化策略时,尊重序列级依赖关系的重要性。

关键词

引用

@article{arxiv.2507.15778,
  title  = {Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR},
  author = {Jiakang Wang and Runze Liu and Fuzheng Zhang and Xiu Li and Guorui Zhou and Ling Pan},
  journal= {arXiv preprint arXiv:2507.15778},
  year   = {2026}
}