Machine Learning · Computer Science
GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning
Ziru Liu, Cheng Gong, Xinyu Fu, Yaofang Liu +6
2025-07-17
Computation and Language · Computer Science
Train Long, Think Short: Curriculum Learning for Efficient Reasoning
Hasan Abed Al Kader Hammoud, Kumail Alhamoud, Abed Hammoud, Elie Bou-Zeid +2
2025-08-13
Artificial Intelligence · Computer Science
CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
Shijie Zhang, Guohao Sun, Kevin Zhang, Xiang Guo +1
2025-09-30
Machine Learning · Computer Science
OThink-MR1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning
Zhiyuan Liu, Yuting Zhang, Feng Liu, Changwang Zhang +2
2025-03-31
Cryptography and Security · Computer Science
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
Marco Simoni, Aleksandar Fontana, Giulio Rossolini, Andrea Saracino
2025-07-08
Artificial Intelligence · Computer Science
M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization
Bizhe Bai, Hongming Wu, Peng Ye, Tao Chen
2025-12-16
Robotics · Computer Science
TGRPO :Fine-tuning Vision-Language-Action Model via Trajectory-wise Group Relative Policy Optimization
Zengjue Chen, Runliang Niu, He Kong, Qi Wang +2
2025-09-30
Computer Vision and Pattern Recognition · Computer Science
All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He +2
2026-04-02
Computation and Language · Computer Science
Improving Generalization in Intent Detection: GRPO with Reward-Based Curriculum Sampling
Zihao Feng, Xiaoxue Wang, Ziwei Bai, Donghang Su +3
2025-04-22
Computer Vision and Pattern Recognition · Computer Science
From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning
Omar Sharif, Eftekhar Hossain, Patrick Ng
2026-01-05
Robotics · Computer Science
CuRLA: Curriculum Learning Based Deep Reinforcement Learning for Autonomous Driving
Bhargava Uppuluri, Anjel Patel, Neil Mehta, Sridhar Kamath +1
2025-01-10
Computer Vision and Pattern Recognition · Computer Science
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
Jiangyang Li, Cong Wan, SongLin Dong, Chenhao Ding +3
2026-03-17
Computation and Language · Computer Science
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
Wenhui Zhu, Xuanzhao Dong, Xin Li, Peijie Qiu +5
2025-05-21
Machine Learning · Computer Science
GRPO-RM: Fine-Tuning Representation Models via GRPO-Driven Reinforcement Learning
Yanchen Xu, Ziheng Jiao, Hongyuan Zhang, Xuelong Li
2025-11-20
Audio and Speech Processing · Electrical Eng. & Systems
Group Relative Policy Optimization for Speech Recognition
Prashanth Gurunath Shivakumar, Yile Gu, Ankur Gandhe, Ivan Bulyko
2025-09-03
Computer Vision and Pattern Recognition · Computer Science
Visually-Guided Policy Optimization for Multimodal Reasoning
Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu +4
2026-05-25
Computer Vision and Pattern Recognition · Computer Science
Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization
Jinghan Li, Junfeng Fang, Jinda Lu, Yuan Wang +4
2026-02-27
Cryptography and Security · Computer Science
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
Xuankun Rong, Wenke Huang, Tingfeng Wang, Daiguo Zhou +2
2025-11-18
Robotics · Computer Science
MTDrive: Multi-turn Interactive Reinforcement Learning for Autonomous Driving
Xidong Li, Mingyu Guo, Chenchao Xu, Bailin Li +4
2026-02-02
Computation and Language · Computer Science
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
Zhongwei Wan, Zhihao Dou, Che Liu, Yu Zhang +10
2025-10-07
Computation and Language · Computer Science
Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization
Yueyang Cang, Xiaoteng Zhang, Erlu Zhao, Zehua Ji +6
2026-03-04