Machine Learning · Computer Science
On the Hidden Objective Biases of Group-based Reinforcement Learning
Aleksandar Fontana, Marco Simoni, Giulio Rossolini, Andrea Saracino +1
2026-01-09
Computer Vision and Pattern Recognition · Computer Science
GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
Jing Wang, Jiajun Liang, Jie Liu, Henglin Liu +9
2025-10-31
Computation and Language · Computer Science
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
Ziheng Li, Liu Kang, Feng Xiao, Luxi Xing +6
2026-01-13
Machine Learning · Computer Science
Learning to Utilize Shaping Rewards: A New Approach of Reward Shaping
Yujing Hu, Weixun Wang, Hangtian Jia, Yixiang Wang +4
2020-11-06
Machine Learning · Computer Science
Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities
Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets
2026-02-09
Machine Learning · Computer Science
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
Youssef Mroueh, Nicolas Dupuis, Brian Belgodere, Apoorva Nitsure +5
2025-06-02
Machine Learning · Computer Science
Direct Policy Gradients: Direct Optimization of Policies in Discrete Action Spaces
Guy Lorberbom, Chris J. Maddison, Nicolas Heess, Tamir Hazan +1
2020-10-26
Computation and Language · Computer Science
From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks
Changpeng Yang, Jinyang Wu, Yuchen Liu, Shuai Zhang +8
2025-12-16
Artificial Intelligence · Computer Science
MAPO: Mixed Advantage Policy Optimization
Wenke Huang, Quan Zhang, Yiyang Fang, Jian Liang +10
2025-09-26
Machine Learning · Computer Science
P^2O: Joint Policy and Prompt Optimization
Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao +5
2026-05-08
Machine Learning · Computer Science
V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think
Bingda Tang, Yuhui Zhang, Xiaohan Wang, Jiayuan Mao +2
2026-04-28
Machine Learning · Computer Science
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
Chujie Zheng, Kai Dang, Bowen Yu, Mingze Li +9
2025-12-04
Machine Learning · Computer Science
GOPO: Policy Optimization using Ranked Rewards
Kyuseong Choi, Dwaipayan Saha, Woojeong Kim, Anish Agarwal +1
2026-02-05
Artificial Intelligence · Computer Science
Temporal-Logic-Based Reward Shaping for Continuing Reinforcement Learning Tasks
Yuqian Jiang, Sudarshanan Bharadwaj, Bo Wu, Rishi Shah +2
2023-01-18
Machine Learning · Computer Science
Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
Zhipeng Chen, Xiaobo Qin, Youbin Wu, Yue Ling +3
2025-08-15
Machine Learning · Computer Science
Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity
Abhishek Gupta, Aldo Pacchiano, Yuexiang Zhai, Sham M. Kakade +1
2022-10-19
Neural and Evolutionary Computing · Computer Science
Improving Gradient Estimation in Evolutionary Strategies With Past Descent Directions
Florian Meier, Asier Mujika, Marcelo Matheus Gauy, Angelika Steger
2019-10-14
Artificial Intelligence · Computer Science
GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
Kaichen Zhang, Yuzhong Hong, Junwei Bao, Hongfei Jiang +3
2025-10-28