DelTA:基于可验证奖励的判别式标记信用分配
机器学习
2026-05-21 v1 计算与语言
摘要
从可验证奖励进行的强化学习 (RLVR) 已成为提高大型语言模型推理能力的核心技术。尽管其有效,但如何将响应级别的奖励转化为标记级别的概率变化仍不为人所知。我们提出了 RLVR 更新视角的判别器视图,表明策略梯度更新方向在标记-梯度向量上隐式地充当线性判别器,从而决定在学习期间哪些标记概率被增加或减少。在标准序列级 RLVR 中,该判别器由由奖励加权平均标记-梯度向量形成的正负-side 质心构成。然而,这种质心构建可能被共享的高频模式(如格式化标记)主导,从而稀释那些能更好区分高奖励响应与低奖励响应的稀疏且判别性更强的方向。为此,我们提出了 ,一种判别式标记信用分配方法,该方法估计标记系数以放大 side-specific 标记梯度方向并削弱共享或判别性较弱的方向。这些系数对自归一化 RLVR 代理函数进行重新加权,使有效的 side-wise 质心更具对比度,从而重新塑造 RLVR 更新方向。在七个数学基准测试中,DelTA 在 Qwen3-8B-Base 和 Qwen3-14B-Base 上分别以 3.26 和 2.62 的平均分超越了最强的同规模基线方法。额外的结果在代码生成、不同的主干模型以及域外评估中进一步证明了 DelTA 的泛化能力。
引用
@article{arxiv.2605.21467,
title = {DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards},
author = {Kaiyi Zhang and Wei Wu and Yankai Lin},
journal= {arXiv preprint arXiv:2605.21467},
year = {2026}
}