Computation and Language · Computer Science
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
Yuxin Jiang, Yufei Wang, Qiyuan Zhang, Xingshan Zeng +5
2026-01-27
Machine Learning · Computer Science
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
Yu Huang, Zixin Wen, Yuejie Chi, Yuting Wei +3
2026-05-07
Computation and Language · Computer Science
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
Yi Su, Dian Yu, Linfeng Song, Juntao Li +4
2025-04-02
Artificial Intelligence · Computer Science
Reinforcement Learning with Rubric Anchors
Zenan Huang, Yihong Zhuang, Guoshan Lu, Zeyu Qin +17
2025-08-19
Artificial Intelligence · Computer Science
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
Xumeng Wen, Zihan Liu, Shun Zheng, Shengyu Ye +8
2025-10-03
Machine Learning · Computer Science
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
Xitai Jiang, Zihan Tang, Wenze Lin, Yang Yue +2
2026-05-22
Machine Learning · Computer Science
ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
Bonan Zhang, Zhongqi Chen, Bowen Song, Qinya Li +2
2025-09-23
Artificial Intelligence · Computer Science
Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation
Mengyu Zhang, Siyu Ding, Weichong Yin, Yu Sun +1
2026-02-05
Artificial Intelligence · Computer Science
The Reasoning Boundary Paradox: How Reinforcement Learning Constrains Language Models
Phuc Minh Nguyen, Chinh D. La, Duy M. H. Nguyen, Nitesh V. Chawla +2
2025-10-03
Computation and Language · Computer Science
Rethinking Multiple-Choice Questions for RLVR: Unlocking Potential via Distractor Design
Xu Guo, Qiming Ge, Jian Tong, Kedi Chen +7
2026-03-16
Computation and Language · Computer Science
RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
Yukun Chen, Jiaming Li, Longze Chen, Ze Gong +9
2026-03-04
Computation and Language · Computer Science
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
Cheonbok Park, Jeonghoon Kim, Joosung Lee, Sanghwan Bae +2
2026-02-24
Machine Learning · Computer Science
Outcome-based Reinforcement Learning to Predict the Future
Benjamin Turtel, Danny Franklin, Kris Skotheim, Luke Hewitt +1
2025-12-02
Computation and Language · Computer Science
Language Models that Think, Chat Better
Adithya Bhaskar, Xi Ye, Danqi Chen
2025-09-25
Computation and Language · Computer Science
Proof-RM: A Scalable and Generalizable Reward Model for Math Proof
Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang +6
2026-02-20
Machine Learning · Computer Science
Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning
Tiehua Mei, Minxuan Lv, Leiyu Pan, Zhenpeng Su +4
2026-03-11
Computer Vision and Pattern Recognition · Computer Science
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs
Ahmadreza Jeddi, Hakki Can Karaimer, Hue Nguyen, Zhongling Wang +7
2026-03-17
Artificial Intelligence · Computer Science
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
Hong Wang, Zhezheng Hao, Jian Luo, Chenxing Wei +5
2026-04-28
Computation and Language · Computer Science
Document Reconstruction Unlocks Scalable Long-Context RLVR
Yao Xiao, Lei Wang, Yue Deng, Guanzheng Chen +5
2026-03-03