中文

学习-区域能量:高效RL后训练的在线数据选择

机器学习 2026-05-20 v2 人工智能

摘要

强化学习(RL)后训练已成为从大型语言模型(LLM)中激发数学推理能力的主导范式,但现存方法如GRPO和DAPO将 rollout 和梯度预算几乎均匀分配到各提示样本上,在模型已掌握的样本或远超当前能力的样本上浪费计算资源。为解决这一根本性效率问题,我们提出学习-区域能量(LZE),这是一种在线数据选择框架,聚焦于模型的主动学习前沿。其核心是定义一个闭形式的学习-区域能量得分,将三个互补信号融合为单个标量:初始难度锚、归一化结果不确定性项和通过率动量。该得分与组相对策略梯度更新幅度的预期值可证明呈正相关。我们进一步设计了一个带回放的前向剪枝器,跳过持续已解决的提示的 rollout 生成,同时定期检查遗忘情况。在Qwen系列模型(1.5B-8B)上的GSM8K、MATH和DAPO-MATH评估显示,我们的方法仅保留每步40%的训练数据,却能匹配或超越全数据基线,尤其在AIME25(+45.9%)和AMC23(+18.2%)等超出分布任务上表现显著,同时估计可减少36%的训练FLOPs。我们的代码已公开于https://github.com/Stellaris167/LZE。

关键词

引用

@article{arxiv.2605.17003,
  title  = {Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training},
  author = {Peng Cui and Boyao Yang and Jun Zhu},
  journal= {arXiv preprint arXiv:2605.17003},
  year   = {2026}
}