中文

低概率记号维持强化学习中的探索:面向可验证奖励

机器学习 2025-11-10 v2 计算与语言

摘要

可验证奖励的强化学习(RLVR)已推动大型语言模型在复杂推理任务中的应用,但其可扩展性常受训练瓶颈的限制,即随着策略熵崩溃,性能停滞,表明探索丧失。以往方法通常通过维持高策略熵来解决此问题,但确切的机制以何种方式实现有意义的探索仍未得到充分探讨。我们的分析表明,过度关注熵风险可能放大无关记号并 destabilize 训练。本文调查 RLVR 中的探索动态,识别出一个关键问题:有价值的低概率探索记号逐渐被消除,我们称为“\textbf{\textit{reasoning sparks}}”。我们发现,这些火花在预训练模型中丰富,但在 RLVR 期间因过度惩罚而被系统性地熄灭,导致探索退化。为此,我们引入低概率正则化(Lp-Reg)。其核心机制是将策略正则化为一个启发式代理分布。该代理通过过滤掉假定的噪声记号并对剩余候选者重新归一化分布来构建。结果是较少噪声的代理,其中“reasoning sparks”的概率被放大,随后作为软正则化目标,作为防止这些有价值记号通过 KL 散度被消除的屏障。实验表明,Lp-Reg 使在策略 RL 中实现稳定,持续跨越 3,0003,000 步训练和 81,20481,204 GPU 小时,其中基线熵控制方法崩溃。这种持续的探索导致达到最佳性能,实现对五个数学基准的平均准确率达到 60.17%60.17\%,比先前方法提高了 2.66%2.66\%。代码已公开于 https://github.com/CarlanLark/Lp-Reg。

关键词

引用

@article{arxiv.2510.03222,
  title  = {Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward},
  author = {Guanhua Huang and Tingqiang Xu and Mingze Wang and Qi Yi and Xue Gong and Siheng Li and Ruibin Xiong and Kejiao Li and Yuhao Jiang and Bo Zhou},
  journal= {arXiv preprint arXiv:2510.03222},
  year   = {2025}
}