中文

单次 rollout 隐藏状态动力学用于无训练 RLVR 数据选择

机器学习 2026-05-28 v1

摘要

强化学习可验证奖励 (RLVR) 能从极少的训练实例中获得显著推理提升,但其对所选实例高度敏感,使数据选择成为核心瓶颈。现有大多数选择流程依赖训练时优化信号或需要访问可验证奖励或 ground-truth 答案才能从大型候选池中进行选择,这在专业领域代价高昂且往往不可行。我们研究无训练的 RLVR 数据选择场景,即必须在任何 RL 训练前进行选择,且无法对完整候选池进行标签或奖励评估。我们提出了 SHIFT,一种基于推理时隐藏状态动力学的单次、无训练选择器。对于每个候选实例,SHIFT 执行一次确定性推理 rollout,并计算从 start 到 end 的隐藏状态变化(reasoning-induced representation shift, RIRS)作为推理引起的表示偏移。SHIFT 采用 RIRS 大小作为实例效用性的轻量级代理,并通过 RIRS 增强特征空间中的质量加权最远-FIRST CoreSet 程序来实现覆盖,从而产生可扩展至大型无标签池的紧凑子集。在数学推理和医学 QA 基准测试中,在极低预算下,SHIFT 持续优于无训练多样性和难度/不确定性基线,提升了准入准确率和对更难评估设置的迁移。消融实验表明,RIRS 基于的覆盖和质量加权贡献互补的提升,分析表明 RIRS 不可归因于简单输入/输出长度统计。代码已在 github.com/JianghaoWu/SHIFT 上提供。

关键词

引用

@article{arxiv.2605.28631,
  title  = {Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection},
  author = {Jianghao Wu and Jianfei Cai and Weiqiang Wang and Jin Ye and Daniel F. Schmidt and Yasmeen George},
  journal= {arXiv preprint arXiv:2605.28631},
  year   = {2026}
}

备注

14 pages, 2 figures. Accepted by ICML 2026