Computation and Language · Computer Science
When Actions Teach You to Think: Reasoning-Action Synergy via Reinforcement Learning in Conversational Agents
Mrinal Rawat, Arkajyoti Chakraborty, Neha Gupta, Roberto Pieraccini
2025-12-15
Computation and Language · Computer Science
ReFT: Reasoning with Reinforced Fine-Tuning
Trung Quoc Luong, Xinbo Zhang, Zhanming Jie, Peng Sun +2
2024-12-16
Artificial Intelligence · Computer Science
Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning
Benjamin Gundersen, Nicolas Deperrois, Samuel Ruiperez-Campillo, Thomas M. Sutter +4
2025-12-12
Machine Learning · Computer Science
A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning
Hiroshi Yoshihara, Taiki Yamaguchi, Yuichi Inoue
2025-07-14
Computation and Language · Computer Science
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
Yuqian Fu, Tinghong Chen, Jiajun Chai, Xihuai Wang +6
2025-06-25
Machine Learning · Computer Science
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
Huayu Chen, Kaiwen Zheng, Qinsheng Zhang, Ganqu Cui +7
2026-03-03
Computation and Language · Computer Science
Beyond path selection: Better LLMs for Scientific Information Extraction with MimicSFT and Relevance and Rule-induced(R$^2$)GRPO
Ran Li, Shimin Di, Yuchen Liu, Chen Jing +2
2025-05-29
Artificial Intelligence · Computer Science
On-Policy Supervised Fine-Tuning for Efficient Reasoning
Anhao Zhao, Ziyang Chen, Junlong Tong, Yingqi Fan +5
2026-02-17
Machine Learning · Computer Science
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
Yongcan Yu, Lingxiao He, Shuo Lu, Lijun Sheng +9
2025-12-16
Computation and Language · Computer Science
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
Wenhui Zhu, Xuanzhao Dong, Xin Li, Peijie Qiu +5
2025-05-21
Computation and Language · Computer Science
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
Liang Chen, Xueting Han, Li Shen, Jing Bai +1
2025-10-17
Cryptography and Security · Computer Science
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
Marco Simoni, Aleksandar Fontana, Giulio Rossolini, Andrea Saracino
2025-07-08
Computation and Language · Computer Science
EditGRPO: Reinforcement Learning with Post-Rollout Edits for Clinically Accurate Chest X-Ray Report Generation
Kai Zhang, Christopher Malon, Lichao Sun, Martin Renqiang Min
2025-11-11
Machine Learning · Computer Science
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
Wei Xiong, Jiarui Yao, Yuhui Xu, Bo Pang +7
2025-06-13
Computation and Language · Computer Science
Reinforcement Learning for LLM Post-Training: A Survey
Zhichao Wang, Kiran Ramnath, Bin Bi, Shiva Kumar Pentyala +8
2026-05-19
Artificial Intelligence · Computer Science
Minor SFT loss for LLM fine-tune to increase performance and reduce model deviation
Shiming Xie, Hong Chen, Fred Yu, Zeye Sun +1
2024-08-21
Artificial Intelligence · Computer Science
Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients
Armin Berger, Manuela Bergau, Helen Schneider, Saad Ahmad +6
2026-01-05
Computation and Language · Computer Science
OncoReason: Structuring Clinical Reasoning in LLMs for Robust and Interpretable Survival Prediction
Raghu Vamshi Hemadri, Geetha Krishna Guruju, Kristi Topollai, Anna Ewa Choromanska
2025-10-21
Machine Learning · Computer Science
The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmic Improvement from Clinical Decision-making Quality
Dou Liu, Ying Long, Sophia Zuoqiu, Kaipeng Xie +7
2025-11-25
Computer Vision and Pattern Recognition · Computer Science
On the Suitability of Reinforcement Fine-Tuning to Visual Tasks
Xiaxu Chen, Wei Li, Chunxu Liu, Chi Xie +4
2025-09-23
Machine Learning · Computer Science
From Solving to Verifying: A Unified Objective for Robust Reasoning in LLMs
Xiaoxuan Wang, Bo Liu, Song Jiang, Jingzhou Liu +3
2025-11-20