基于可验证奖励的强化学习中的非对称提示加权
机器学习
2026-02-12 v1
摘要
可验证奖励的强化学习推动了LLM后训练领域的最新进展,尤其是针对推理任务。策略优化算法为给定提示生成多个响应,然后根据奖励有效地对相应的梯度进行加权。最流行的算法包括GRPO、DAPO和RLOO专注于含糊不清的提示,即成功概率处于中间水平的提示,同时对非常容易和非常困难的提示进行降权。在本文中,我们考虑非对称提示加权,即对成功概率较低,甚至为零的提示分配更高的权重。我们发现,非对称加权在从零开始的RL(如R1-Zero)中尤其有效,因为训练跨越了较大的准确率范围,而在后SFT RL中则效果有限,因为模型已经以较高的准确率开始。我们还提供了理论,描述在固定更新预算下,提升成功概率从初始水平到目标准确率所需时间的提示权重。
引用
@article{arxiv.2602.11128,
title = {Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards},
author = {Reinhard Heckel and Mahdi Soltanolkotabi and Christos Thramboulidis},
journal= {arXiv preprint arXiv:2602.11128},
year = {2026}
}