公平裁剪序列:为序列级强化学习实现长度公平性
机器学习
2025-10-14 v3 人工智能
计算与语言
摘要
我们提出了 FSPO(Fair Sequence Policy Optimization),这是一种用于大型语言模型(LLM)的序列级强化学习方法,通过对重要性抽样(IS)权重实施长度公平裁剪。我们研究了基于序列级 IS 的 RL 方法,并发现当 PPO/GRPO 风格的裁剪被移植到序列上时,会出现偏差:固定的裁剪范围系统性地对短于长回复进行重新加权,从而扭曲了优化方向。FSPO 引入了一个简单的补救措施:以比例为 的带宽对序列对数 IS 比值进行裁剪。理论上,我们通过长度重加权误差(LRE)形式化了长度公平性,并证明小的 LRE 可保证被裁剪更新与真实更新之间具有余弦方向保证。实验上,FSPO 在长度区间中平抑了裁剪率,稳定了训练,并在不同模型规模和评估数据集上超越了基线方法,其中在 Qwen3-8B-Base 模型上获得了最大的提升。
引用
@article{arxiv.2509.09177,
title = {Clip Your Sequences Fairly: Enforcing Length Fairness for Sequence-Level RL},
author = {Hanyi Mao and Quanjia Xiao and Lei Pang and Haixiao Liu},
journal= {arXiv preprint arXiv:2509.09177},
year = {2025}
}