经典强化学习环境中 GRPO 的再思考: 无评论器?
机器学习
2025-11-06 v1
摘要
组相对策略优化 (GRPO) 作为消除学习型评论器、改用轨迹组内相对比较来估计优势的 PPO 替代方案,正在成为可扩展方法。这一简化引出关于学习型基准在策略梯度方法中必要性的根本问题。我们首次系统研究 GRPO 在经典单任务强化学习环境中的表现,涵盖离散与连续控制任务。通过控制消除基准、折扣及组采样的消融实验,我们揭示三个关键发现: (1) 在长时序任务中,学习型评论器仍必不可少:所有无评论器基准在 PPO 下均表现不佳,唯有 CartPole 等短时序环境可行; (2) GRPO 在高折扣因子 (gamma=0.99) 下表现良好,唯有 HalfCheetah 因缺乏早期终止而需中等折扣 (gamma=0.9); (3) 小组规模优于大组规模,暗示基于小批次分组策略混合无关 episode 的局限性。这些结果揭示了无评论器方法在经典控制中的局限性,以及特定条件下其作为学习型价值函数替代方案的可行性。
引用
@article{arxiv.2511.03527,
title = {Learning Without Critics? Revisiting GRPO in Classical Reinforcement Learning Environments},
author = {Bryan L. M. de Oliveira and Felipe V. Frujeri and Marcos P. C. M. Queiroz and Luana G. B. Martins and Telma W. de L. Soares and Luckeciano C. Melo},
journal= {arXiv preprint arXiv:2511.03527},
year = {2025}
}