中文

让裁判沉默:基于潜在几何聚类的自验证器强化学习

计算与语言 2026-03-03 v2 机器学习

摘要

Group Relative Policy Optimization (GRPO) 显著提升了 Large Language Models (LLMs) 的推理性能。然而,这一成功严重依赖于昂贵的外部验证器或人类规则。这种依赖不仅导致显著的计算成本和训练延迟,而且产生稀疏奖励,阻碍了优化效率。为了应对这些挑战,我们提出了 Latent-GRPO,这是一个直接从潜在空间几何中导出内在奖励的框架。关键的是,我们的实证分析揭示了一个引人注目的几何特性:正确推理轨迹的终端 token 表示形成了具有高类内相似性的密集簇,而错误轨迹则作为离群点保持分散。基于这一发现,我们引入了 Iterative Robust Centroid Estimation (IRCE) 算法,该算法通过球面投影减轻幅度波动,并通过迭代聚合估计稳健的“真实质心”,从而生成密集、连续的奖励。在多个数据集上的实验结果表明,我们的方法在保持模型性能的同时,与基线相比实现了超过 2 倍的训练加速。此外,广泛的结果证明了其强大的泛化能力和鲁棒性。代码即将发布。

关键词

引用

@article{arxiv.2601.08427,
  title  = {Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering},
  author = {Nonghai Zhang and Weitao Ma and Zhanyu Ma and Jun Xu and Jiuchong Gao and Jinghua Hao and Renqing He and Jingwen Xu},
  journal= {arXiv preprint arXiv:2601.08427},
  year   = {2026}
}