SCOPE-RL:稳定量化控制强化学习后训练中的策略熵
机器学习
2026-05-19 v7
摘要
强化学习(RL)是后训练大型语言模型(LLMs)的关键范式,但广泛使用的 Group Relative Policy Optimization(GRPO)常出现熵崩溃:探索迅速消失,策略提前收敛,样本多样性下降,最终损害训练效果。现有补救措施,包括熵奖励和裁剪方法,很难将熵维持在稳定的探索区间,常导致熵或奖励出现振荡。本文识别到熵动力学中一个被忽视的非对称性:在高温采样下,正样本和负样本对策略熵的影响方向相反。具体而言,高温正样本促进熵增长,而负样本则抑制熵。我们提供了该现象的理论解释:当策略更新导致熵减小时,其对温度的导数在正样本更新下严格为正,表明高温正样本可抵消熵衰减,从而减缓熵崩溃,甚至可能逆转。鼓舞此洞见,我们提出 SCOPE-RL—a 稳定且量化的熵控制框架,通过基于温度自适应正样本构建的正则化项实现。大量实验表明,SCOPE-RL 在 Pass@1 和 Pass@$k 指标上均持续优于强大的 RL 基线。我们的结果表明,摆脱熵崩溃可提升推理性能,同时显示益处非单调且存在最佳探索水平。
引用
@article{arxiv.2510.08141,
title = {SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training},
author = {Chen Wang and Zhaochun Li and Jionghao Bai and Hexuan Deng and Ge Lan and Yue Wang},
journal= {arXiv preprint arXiv:2510.08141},
year = {2026}
}