超越归一化:将分区函数重新解释为强化学习中的难度调度器
计算与语言
2026-05-29 v2 人工智能
摘要
最大化奖励的强化学习方法已显示出增强大语言模型推理性能的能力,但往往导致生成多样性下降。近期研究通过采用 GFlowNets 来解决此问题,在匹配目标分布的同时联合学习其分区函数。与先前方法不同,我们将该分区函数重新解释为每个提示的预期奖励(即在线准确率)信号,利用这一未被充分利用的信息来提高样本效率。具体而言,我们首先在分区函数与每个提示准确率估计之间建立理论关系。基于这一关键洞察,我们提出了分区函数引导强化学习(PACED-RL),一种后训练框架,利用准确率估计在训练期间优先处理有信息量的题目提示,并通过准确率估计误差优先级回放进一步提高样本效率。关键在于,两个组件都重用了 GFlowNet 训练期间已产生的信息,有效地将计算开销在现有优化过程中摊薄。广泛的实验结果表明,我们的方法在 GRPO 和先前 GFlowNets 方法方面实现了显著的性能提升,凸显 PACED-RL 作为更高效分布匹配训练大语言模型的有前景的方向。
引用
@article{arxiv.2602.12642,
title = {Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR},
author = {Dohyung Kim and Minbeom Kim and Jeonghye Kim and Sangmook Lee and Sojeong Rhee and Kyomin Jung},
journal= {arXiv preprint arXiv:2602.12642},
year = {2026}
}