中文

长度偏置序列策略优化:揭示与控制RLVR中响应长度变化

计算与语言 2026-02-06 v1

摘要

近期将强化学习可验证奖励(RLVR)应用于大型语言模型(LLM)和视觉语言模型(VLM),在提升复杂任务推理能力方面取得显著成功。在RLVR训练过程中,响应长度增长常被视为推理能力提升的关键因素。然而,不同RLVR算法在训练过程中响应长度变化模式存在显著差异。为提供这些差异的根本解释,本文对主流RLVR算法组件进行深入分析。我们进行理论分析,阐明影响响应长度的因素,并通过大量实验验证理论。基于这些理论发现,我们提出长度偏置序列策略优化(LUSPO)算法。具体而言,我们纠正了组序列策略优化(GSPO)中固有的长度偏置,使其损失函数相对于响应长度保持无偏,从而解决响应长度坍缩问题。在数学推理基准和多模态推理场景中进行了大量实验,LUSPO consistently 实现了优异的性能。实证结果表明,LUSPO代表了一种新型、相对于现有方法(如GRPO和GSPO)的前沿优化策略。

关键词

引用

@article{arxiv.2602.05261,
  title  = {Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR},
  author = {Fanfan Liu and Youyang Yin and Peng Shi and Siqi Yang and Zhixiong Zeng and Haibo Qiu},
  journal= {arXiv preprint arXiv:2602.05261},
  year   = {2026}
}