中文

Latent-GRPO:面向潜在推理的分组相对策略优化

机器学习 2026-05-01 v1 计算与语言

摘要

潜在推理通过将中间推理压缩为连续表示并大幅缩短推理链,提供了一种比显式推理更高效的替代方案。然而,现有的潜在推理方法主要侧重于监督学习,而潜在空间中的强化学习仍然高度不稳定。我们通过分组相对策略优化(GRPO)的视角研究此问题,并表明直接将GRPO应用于潜在推理从根本上并非易事:潜在推理同时改变了概率密度和采样机制,导致三个耦合的瓶颈:缺乏内在潜在流形,无约束的探索会将生成序列推出有效的潜在流形;探索-优化错位,轨迹级奖励可能导致不正确的令牌级更新;以及潜在混合非闭合性,联合强化多条正确的潜在路径可能产生无效的平均状态。为解决这些问题,我们提出了\textbf{Latent-GRPO},它结合了无效样本优势掩蔽、单侧噪声采样和最优正确路径首令牌选择。在四个低难度基准测试(如GSM8K-Aug)和四个高难度基准测试(如AIME)上,Latent-GRPO在低难度任务上比其潜在初始化提高了7.86个Pass@1点,在高难度任务上超越了显式GRPO 4.27个点,同时使用的推理链缩短了3--4×\times。在Gumbel采样下,它还实现了更强的pass@kk性能。这些结果确立了Latent-GRPO作为一种有效且稳定的潜在推理方法。

关键词

引用

@article{arxiv.2604.27998,
  title  = {Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning},
  author = {Jingcheng Deng and Zihao Wei and Liang Pang and Junhong Wu and Shicheng Xu and Zenghao Duan and Huawei Shen},
  journal= {arXiv preprint arXiv:2604.27998},
  year   = {2026}
}

备注

This is an actively developing work, and we will continue to update the arXiv version