复杂损失函数是否是教会 LLM 推理的必要条件?
机器学习
2026-03-20 v1 人工智能
计算与语言
摘要
近期大型语言模型(LLM)的进展凸显了后训练技术在提升推理和数学能力方面的重要性。Group Relative Policy Optimization(GRPO)通过结合组相对优势估计、PPO 风格的裁剪和 KL 正则化,在此领域展现了前景。然而,其复杂性引发了一个问题:是否所有组件都对培育推理行为至关重要?我们对 GRPO 进行系统性分析,识别出两个关键发现:(1)仅在基于基准线之上的动作上进行训练时,纠纳负反馈是必不可少的,学习将受到限制;(2)PPO 风格的约束,如策略比例裁剪,不需要来提高数学推理或性能。基于这些见解,我们提出了基于组相对优势的 REINFORCE 方法(RGRA),这是一种简化的变体,保留了组相对优势估计,但移除了 PPO 风格的裁剪和策略比例项。跨越标准数学基准的实验表明,RGRA 有望超过 GRPO 实现更佳性能。我们的结果表明,更简单的基于 REINFORCE 的方法可以有效增强 LLM 的推理能力,为 GRPO 提供了更透明和高效的替代方案。
引用
@article{arxiv.2603.18756,
title = {Are complicated loss functions necessary for teaching LLMs to reason?},
author = {Gabriele Carrino and Andrea Sassella and Nicolo Brunello and Federico Toschi and Mark James Carman},
journal= {arXiv preprint arXiv:2603.18756},
year = {2026}
}