令牌隐式奖励:在群体相对深度强化学习中引导探索-开发平衡
机器学习
2026-02-17 v4 计算与语言
摘要
基于可验证奖励的强化学习已显著推动了大型语言模型推理能力的发展,但如何显式引导训练朝向探索或开发仍是未解之谜。我们提出令牌隐式奖励 (Token Hidden Reward, THR),这是一种衡量每个令牌对正确响应可能性影响的指标,用于群体相对策略优化 (Group Relative Policy Optimization, GRPO)。我们发现,训练动力由少数具有高绝对 THR 值令牌主导。最有趣的是,正向 THR 的令牌强化正确输出的置信度,从而偏好开发,而负向 THR 的令牌保留备选输出的概率质量,从而实现探索。这一洞察建议一种自然的干预:一种 THR 指导的重新加权算法,可调节 GRPO 的学习信号,以显式偏向开发或探索。我们在多样化的数学推理基准测试上验证了该算法的有效性。通过放大正向 THR 值并削弱负向 THR,我们的算法提高了贪婪解码准确率,偏好开发。相反的策略在 Pass@K 准确率上实现持续的改进,偏好探索。我们进一步展示了该算法可无缝集成到其他 RL 目标(如 GSPO)中,并可跨架构(包括 Llama)进行推广。这些发现确立了 THR 作为动态控制 RL 调整后大语言模型中探索与开发的原则性且细粒度的机制,为推理密集型应用中的有针对性微调提供了新工具。
引用
@article{arxiv.2510.03669,
title = {Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning},
author = {Wenlong Deng and Yi Ren and Yushu Li and Boying Gong and Danica J. Sutherland and Xiaoxiao Li and Christos Thrampoulidis},
journal= {arXiv preprint arXiv:2510.03669},
year = {2026}
}
备注
Full version of submission to 2nd AI for Math Workshop@ ICML 2025 (best paper)