SAGE:基于引导探索的 RLVR 中的锚点塑造框架
机器学习
2026-05-20 v1 人工智能
计算与语言
摘要
最近的研究发现,强化学习与可验证奖励(RLVR)在推理任务中可靠地提高 pass@1,但在 pass@k 方面往往难以实现可比的提升,这引出了一个问题:RLVR 是否真正使大型语言模型获得新的推理能力,抑或仅提高了基础模型中已存在推理模式的采样效率。先前的分析大多支持后者,认为标准 RLVR 目标的结构性属性导致探索压力不足。在本文中,我们认为反向 KL 正则化是核心结构性约束——它稳定训练但本质上将策略锚定在参考分布上,从而抑制了替代推理模式的出现。然而,我们表明,单纯删除 KL 项或替换为前向 KL 都无法满意解决,二者要么导致奖励作弊,要么将概率质量分配给偏离目标的区域。为解决这一矛盾,我们提出 SAGE 框架,通过调整反向 KL 锚点分布本身通过指导函数 q(x,y) 实现可控的经验支持扩展,实现在挑战性数学推理基准上在 pass@1 和 pass@k 两方面稳定提升。我们的代码已发布于 https://github.com/tally0818/SAGE。
引用
@article{arxiv.2605.18864,
title = {SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs},
author = {Chanuk Lee and Minki Kang and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2605.18864},
year = {2026}
}
备注
Preprint