中文

超越方差:基于稀有事件放大与双向配对的提示高效强化学习

机器学习 2026-05-07 v2 人工智能

摘要

基于可验证奖励的强化学习(RLVR)对于训练大型语言模型以解决确定性结果推理任务效果良好。先前工作表明 RLVR 在少量提示下即可工作,但提示选择往往仅基于训练准确率的方差,导致优化方向不稳定且迁移能力较弱。我们从机制层面重新审视提示选择,认为有效的 mini-batch 应同时提供(i)可靠的正向锚点,以及(ii)来自稀有失败的显式负向学习信号。基于此原则,我们提出正负配对(positive--negative pairing)策略:在每一次更新中,我们采样一个难但可解的 q+q^{+} 和一个易但脆弱的提示 qq^{-}(成功率高但并非完美),分别由低和高的经验成功率特征。我们进一步引入加权 GRPO,通过对配对层级的二元结果进行加权,并使用组归一化优势来放大 q+q^{+} 上稀有成功的锐利正向引导,同时将 qq^{-} 上稀有失败转化为强烈的负向惩罚。这种双向信号为成功与失败都提供了信息丰富的学习反馈,在提升样本效率而不抑制探索方面均取得显著效果。在 Qwen2.5-Math-7B 上,单个配对 mini-batch 每次更新均优于采用常用方差基选择启发式挑选两个提示的 GRPO 基线:AIME~2025 Pass@8 从 16.8 提升至 22.2,AMC23 Pass@64 从 94.0 提升至 97.0,且在 1209 个训练提示池中训练的大规模 RLVR 仍保持竞争力。在 Qwen2.5-Math-7B-Instruct 上也观察到类似的提升。

关键词

引用

@article{arxiv.2602.03452,
  title  = {Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing},
  author = {Yujuan Pang and Jiaxin Li and Xin Sheng and Ran Peng and Yong Ma},
  journal= {arXiv preprint arXiv:2602.03452},
  year   = {2026}
}