中文

何时停止重复使用:基于动态梯度门控的样本高效RLVR

机器学习 2026-05-20 v1 人工智能

摘要

基于可验证奖励的强化学习(RLVR)已成为大型语言模型(LLM)中高级推理的主导范式,但 rollout样本获取成本高昂,使得样本效率成为关键瓶颈。一个自然的解决方案是重复使用每个rollout批次进行多次梯度更新,这是经典RL中的标准做法。然而在RLVR中,这会放大策略偏移,导致严重的性能下降。及时检测到性能下降的开始仍是开放且具有挑战性的问题。我们通过识别“不成比例权重发散(Disproportionate Weight Divergence, DWD)”现象来弥合这一差距:性能下降与lm_head权重变化的急剧激增同步,而中间层保持稳定。经验上,我们在各种LLMs和任务中验证了DWD的一致出现。理论上,我们证明了:(i)有害梯度集中在lm_head,而中间层结构被抑制;(ii)lm_head梯度范数下界为策略发散。这些结果将lm_head梯度范数确立为灾难性策略偏移的原则性、实时信号。基于这一洞见,我们提出了“动态梯度门控(Dynamic Gradient Gating, DGG)”,一种轻量级干预措施,实时监控lm_head梯度范数并在其损坏优化器之前拦截有害梯度。DGG在数学、ALFWorld、WebShop和search-augmented QA等任务中始终匹配或超过标准单次使用基线,实现了最高达2.93倍的样本效率和2.14倍的 wall-clock 加速。

关键词

引用

@article{arxiv.2605.19425,
  title  = {When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR},
  author = {Yuchun Miao and Sen Zhang and Yuqi Zhang and Yaorui Shi and Qi Gu and Xunliang Cai and Lefei Zhang},
  journal= {arXiv preprint arXiv:2605.19425},
  year   = {2026}
}

备注

23 pages, 10 figures