VCRL:基于方差的课程强化学习框架用于大语言模型
机器学习
2025-09-25 v1 计算与语言
摘要
基于策略的强化学习目前在提升大语言模型的数学推理能力方面发挥着重要作用。然而,现有的基于采样的强化学习方法(GRPO、DAPO、GSPO 等)未能显式考虑大语言模型对不同难度样本的学习能力,这与人类从易到难进行数学推理的认知过程相悖。从直觉上我们发现,在 RLVR 中采样组的奖励方差在一定程度上反映了当前样本对大语言模型的难度。过易或过难的样本方差较低,而中等难度的样本方差较高。基于此,我们提出了 VCRL,一个基于采样组奖励方差动态控制训练样本难度的课程强化学习框架。在五个数学基准和两个模型上的实验揭示了 VCRL 相较于当前大语言模型强化学习基线的优势。
引用
@article{arxiv.2509.19803,
title = {VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models},
author = {Guochao Jiang and Wenfeng Feng and Guofeng Quan and Chuzhan Hao and Yuewei Zhang and Guohua Liu and Hao Wang},
journal= {arXiv preprint arXiv:2509.19803},
year = {2025}
}