中文

RLVR 中的 VL Norm:重新思考损失聚合

机器学习 2025-10-14 v2 人工智能

摘要

我们提出了 VL Norm(方差降低长度依赖归一化),这是一种针对强化学习可验证奖励(RLVR)中动态生成长度特征的简单而有效的损失聚合方法。最近,RLVR 在提高大型语言模型(LLM)的推理能力方面显示出巨大的潜力,但主要挑战在于训练期间响应长度的大幅波动,导致梯度方差大且优化不稳定。虽然 GRPO、DAPO 和 Dr. GRPO 等先前方法引入了不同的损失归一化术语来解决这一问题,但它们要么产生偏估计,要么仍然 suffer 于高梯度方差。通过对长度变化对策略损失的理论和经验分析,我们将问题重新表述为寻找最小方差无偏估计器。我们的 proposed VL Norm 不仅提供了对真实策略损失的无偏估计,还在理论上最小化梯度方差。此外,VL Norm 实施简单,代码更改不足 10 行。广泛的实验表明,它在不同模型规模、最大长度和任务上始终实现优异结果。当集成到最先进的 RL 算法 DAPO 时,可实现 CountDown 任务上最高可达 2.67 倍的加速收敛。我们的代码已公开于 https://github.com/zerolllin/Delta-L-Normalization。

关键词

引用

@article{arxiv.2509.07558,
  title  = {VL Norm: Rethink Loss Aggregation in RLVR},
  author = {Zhiyuan He and Xufang Luo and Yike Zhang and Yuqing Yang and Lili Qiu},
  journal= {arXiv preprint arXiv:2509.07558},
  year   = {2025}
}