群序列策略优化
机器学习
2025-07-29 v2 人工智能
计算与语言
摘要
本文引入了群序列策略优化 (Group Sequence Policy Optimization, GSPO),这是一种稳定、高效且性能卓越的强化学习算法,用于训练大型语言模型。不同于采用 token 级别重要性比值的先前算法,GSPO 基于序列似然性定义重要性比值,并执行序列级裁剪、奖励和优化。我们展示了 GSPO 在训练效率和性能方面优于 GRPO algorithm,显著稳定了 Mixture-of-Experts (MoE) RL 训练,并具有潜在的简化 RL 基础设施设计。GSPO 的这些优势为最新的 Qwen3 模型取得了显著的性能提升。
引用
@article{arxiv.2507.18071,
title = {Group Sequence Policy Optimization},
author = {Chujie Zheng and Shixuan Liu and Mingze Li and Xiong-Hui Chen and Bowen Yu and Chang Gao and Kai Dang and Yuqiong Liu and Rui Men and An Yang and Jingren Zhou and Junyang Lin},
journal= {arXiv preprint arXiv:2507.18071},
year = {2025}
}