移动边缘处的训练:高效大规模推理模型 RL 训练的在线验证式提示选择
机器学习
2026-03-27 v1 人工智能
摘要
强化学习 (RL) 已成为大型语言模型 (LLM) 在推理任务中后训练的关键手段。虽然扩大 rollout 数量可以稳定训练并提升性能,但计算开销是一个关键问题。在诸如 GRPO 之类的算法中,多个 rollout 每个提示都会导致巨大的成本,因为大部分提示提供的梯度几乎为零,因而实用性极低。为解决此问题,我们研究了在 rollout 阶段之前如何选择高实用性提示。我们的实验分析表明,样本实用性是非均匀且不断变化的:最强的学习信号集中在“学习边缘”,即中间难度和高不确定性的交汇处,而这一点会随着训练的进行而移动。为了实现这一目标,我们提出了 HIVE (History-Informed and online-VErified prompt selection),一种用于数据高效 RL 的双阶段框架。HIVE 利用历史奖励轨迹进行粗略选择,并使用提示熵作为实时代理来剔除实用性过时的实例。通过在多个数学推理基准和模型上评估,我们表明 HIVE 在不损害性能的情况下显著提高了 rollout 效率。
引用
@article{arxiv.2603.25184,
title = {Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model},
author = {Jiahao Wu and Ning Lu and Shengcai Liu and Kun Wang and Yanting Yang and Li Qing and Ke Tang},
journal= {arXiv preprint arXiv:2603.25184},
year = {2026}
}