Artificial Intelligence · Computer Science
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao +4
2025-11-25
Artificial Intelligence · Computer Science
CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning
Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou
2026-05-08
Computation and Language · Computer Science
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
Zhiyuan Zeng, Hamish Ivison, Yiping Wang, Lifan Yuan +13
2025-11-11
Artificial Intelligence · Computer Science
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
Xumeng Wen, Zihan Liu, Shun Zheng, Shengyu Ye +8
2025-10-03
Computation and Language · Computer Science
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
Yi Su, Dian Yu, Linfeng Song, Juntao Li +4
2025-04-02
Machine Learning · Computer Science
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
Mingjie Liu, Shizhe Diao, Jian Hu, Ximing Lu +18
2025-07-18
Computation and Language · Computer Science
Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks
Yihua Zhu, Qianying Liu, Fei Cheng, Jiaxin Wang +3
2026-05-27
Artificial Intelligence · Computer Science
From <Answer> to <Think>: Multidimensional Supervision of Reasoning Process for LLM Optimization
Beining Wang, Weihang Su, Hongtao Tian, Tao Yang +4
2025-10-14
Machine Learning · Computer Science
Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation
Pei-Chi Pan, Yingbin Liang, Sen Lin
2026-02-11
Computation and Language · Computer Science
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
Peisong Wang, Ruotian Ma, Bang Zhang, Xingyu Chen +12
2026-03-05
Artificial Intelligence · Computer Science
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Yu Li, Zhuoshi Pan, Honglin Lin, Mengyuan Sun +2
2025-07-24
Machine Learning · Computer Science
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
Zafir Stojanovski, Oliver Stanley, Joe Sharratt, Richard Jones +3
2025-10-21
Computation and Language · Computer Science
Proof-RM: A Scalable and Generalizable Reward Model for Math Proof
Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang +6
2026-02-20
Computation and Language · Computer Science
ReasonXL: Shifting LLM Reasoning Language Without Sacrificing Performance
Daniil Gurgurov, Tom Röhr, Sebastian von Rohrscheidt, Josef van Genabith +2
2026-04-15
Artificial Intelligence · Computer Science
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
Pinzheng Wang, Shuli Xu, Juntao Li, Yu Luo +3
2026-03-10
Computation and Language · Computer Science
Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models
Runxuan Liu, Xianhao Ou, Xinyan Ma, Jiyuan Wang +12
2026-01-21
Computation and Language · Computer Science
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
Cheonbok Park, Jeonghoon Kim, Joosung Lee, Sanghwan Bae +2
2026-02-24
Machine Learning · Computer Science
Generalization of RLVR Using Causal Reasoning as a Testbed
Brian Lu, Hongyu Zhao, Shuo Sun, Hao Peng +2
2026-03-05
Artificial Intelligence · Computer Science
CoreThink: A Symbolic Reasoning Layer to reason over Long Horizon Tasks with LLMs
Jay Vaghasiya, Omkar Ghugarkar, Vishvesh Bhat, Vipul Dholaria +1
2025-09-04
Machine Learning · Computer Science
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
Zijing Zhang, Ziyang Chen, Mingxiao Li, Zhaopeng Tu +1
2025-07-31
Machine Learning · Computer Science
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
Jinghao Zhang, Naishan Zheng, Ruilin Li, Dongzhou Cheng +3
2025-10-14