中文

基于离-policy 影响导力的数据高效强化学习可验证奖励

机器学习 2026-04-16 v2

摘要

数据选择是强化学习可验证奖励 (RLVR) 中的关键环节,旨在提升大型语言模型 (LLM) 的推理能力。当前的数据选择方法大多基于启发式方法,缺乏理论保证和普适性。本文提出一种基于影响函数的理论依据方法,用于估计每个数据点对学习目标的贡献。为克服在线影响估计所需的策略滚动成本,我们引入一种基于离-policy 影响估计的方法,能够有效地利用预收集的离线轨迹来近似数据影响。此外,为管理大型语言模型的高维梯度,我们采用稀疏随机投影来降维,从而提高存储和计算效率。基于这些技术,我们开发了 Curriculum RL with Off-Policy Influence guidance (CROPI),一个多阶段的强化学习框架,迭代选择当前策略最具影响力的数据。实验表明,CROPI 在参数最多达7B的模型上显著加速了训练。在1.5B模型上,仅使用全数据训练的10%数据即可实现2.66倍的步骤级加速。我们的结果表明,影响力导力的数据选择在高效RLVR中具有巨大的潜力。

关键词

引用

@article{arxiv.2510.26491,
  title  = {Data-Efficient RLVR via Off-Policy Influence Guidance},
  author = {Erle Zhu and Dazhi Jiang and Yuan Wang and Xujun Li and Jiale Cheng and Yuxian Gu and Yilin Niu and Aohan Zeng and Jie Tang and Minlie Huang and Hongning Wang},
  journal= {arXiv preprint arXiv:2510.26491},
  year   = {2026}
}