单流政策优化
机器学习
2025-09-24 v2 人工智能
机器学习
摘要
我们从单流视角重新审视大语言模型(LLM)的政策梯度优化。主流的基于组的方法如GRPO通过即时基线降低方差,但存在关键缺陷:频繁的退化组消除学习信号,同步障碍阻碍可扩展性。我们引入单流政策优化(SPO),通过设计消除这些问题。SPO用持久的、KL自适应价值跟踪器取代每组基线,并在整个batch中全局归一化优势,为每个样本提供稳定、低方差的学习信号。由于无组设计,SPO实现更高的吞吐量,在生成时间各异的长期视角或集成工具的设置中效果更佳。此外,持久的价值跟踪器天然地通过优先级采样实现自适应课程。使用Qwen3-8B的实验表明,SPO比GRPO更顺畅地收敛,准确率更高,同时消除了在退化组上浪费的计算。消融研究确认,SPO的提升源于其对基线估计和优势归一化的原则方法,为LLM推理提供了更稳健、更高效的路径。在五个困难的数学基准测试中使用Qwen3 8B,SPO在平均maj@32上比GRPO提高了3.4个百分点(pp),在BRUMO 25上提高了7.3 pp,在AIME 25上提高了4.4 pp,在HMMT 25上提高了3.3 pp,在评估的各种值上在pass@上实现了一致的相对提升。SPO的成功挑战了在RL算法中添加偶发性复杂性的主流趋势,凸显了基本原理而非架构变通方法驱动LLM推理下一波进步的路径。
引用
@article{arxiv.2509.13232,
title = {Single-stream Policy Optimization},
author = {Zhongwen Xu and Zihan Ding},
journal= {arXiv preprint arXiv:2509.13232},
year = {2025}
}