中文

未校准推理:GRPO 对随机结果引发过度自信

机器学习 2025-08-19 v1 人工智能

摘要

强化学习 (RL) 在数学等可验证且确定性域中显著提升语言模型的准确性。我们检验当前 RL 方法是否同样有效于可验证但具有随机结果的域,如科学实验。通过针对合成数据和真实生物实验的应用, 我们展示了组相对策略优化 (GRPO) 会导致二元随机结果的概率预测过度自信,而近端策略优化 (PPO) 和 REINFORCE Leave-One-Out (RLOO) 则产生良好校准的模型。我们指出,去除 GRPO 中的组标准归一化可修复其失调现象,并提供归一化导致过度自信的理论解释。我们的结果为 RL 在确定性领域之外应用于推理语言模型提供了新证据,同时为此类应用指明了方向。

关键词

引用

@article{arxiv.2508.11800,
  title  = {Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes},
  author = {Michael Bereket and Jure Leskovec},
  journal= {arXiv preprint arXiv:2508.11800},
  year   = {2025}
}