重思序列级强化学习中的比较单位:基于损失校正的等长配对训练框架
机器学习
2026-05-26 v2 人工智能
摘要
本文探讨了序列级相对强化学习中的长度问题。我们观察到,尽管现有方法部分缓解了长度相关现象,但更根本的问题尚未得到充分刻画:训练期间使用的比较单位缺乏内在可比性。基于此观察,我们提出了一种新视角:长度问题不应仅仅视为损失缩放或归一化偏置,而应视为一种比较单位构建问题。我们进一步建立了一种基于样本构建的训练框架,不同于对不等长响应施加事后校正,主动在生成时构建等长、可对齐且可比较的训练片段。该框架内,我们提出了EqLen方法,可应用于GRPO、GSPO和RLOO等组相对比较算法。通过双轨同步生成、前缀继承和片段掩码,EqLen高效地收集有效的等长训练片段,实现稳定训练。
引用
@article{arxiv.2604.17328,
title = {Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction},
author = {Fei Ding and Yongkang Zhang and Runhao Liu and Yuhao Liao and Zijian Zeng and Huiming Yang and Sibo wang and Linglin Liao},
journal= {arXiv preprint arXiv:2604.17328},
year = {2026}
}