C$^2$GSPG:面向自我认知推理的置信校准群序列策略梯度
机器学习
2025-12-24 v2 人工智能
计算与语言
摘要
强化学习(RL)方法,以 Group Relative Policy Optimization(GRPO)及其变体为代表,在开发推理模型中占据核心地位。然而,这些方法常 suffer 严重的过度自信问题,阻碍其实现自我认知的推理模型。本研究提出一种简单而有效的置信校准群序列策略梯度方法,称为 CGSPG,能够在提升推理性能的同时抑制过度自信。原则上,我们提出一种群序列策略梯度(GSPG)框架,用于学习推理模型,消除 GRPO 及其变体中常见的 token 级偏差。在该框架中,我们使用归一化序列级概率定义推理问题的模型置信度,然后应用交叉熵正则化将模型置信度校准为序列的奖励。我们展示置信校准正则化器与 GSPG 对二元奖励协同工作,因其目标始终共享相同的梯度方向。对于非二元奖励,我们应用非线性奖励归一化和自适应正则化裁剪,缓解两者目标潜在的冲突。将 CGSPG 应用于后训练大型语言模型中的逻辑和数学推理任务,我们在推理准确率和置信度校准方面均优于最先进的方法。CGSPG 的代码已公开于 https://github.com/HaotianLiu123/CCGSPG。
引用
@article{arxiv.2509.23129,
title = {C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning},
author = {Haotian Liu and Shuo Wang and Hongteng Xu},
journal= {arXiv preprint arXiv:2509.23129},
year = {2025}
}