Computation and Language · Computer Science
Demystifying Long Chain-of-Thought Reasoning in LLMs
Edward Yeo, Yuxuan Tong, Morry Niu, Graham Neubig +1
2025-02-06
Machine Learning · Computer Science
Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks
ShaoZhen Liu, Xinting Huang, Houwen Peng, Xin Chen +3
2026-01-12
Computation and Language · Computer Science
ReFT: Reasoning with Reinforced Fine-Tuning
Trung Quoc Luong, Xinbo Zhang, Zhanming Jie, Peng Sun +2
2024-12-16
Computation and Language · Computer Science
Long-Short Chain-of-Thought Mixture Supervised Fine-Tuning Eliciting Efficient Reasoning in Large Language Models
Bin Yu, Hang Yuan, Haotian Li, Xueyin Xu +4
2025-05-22
Computation and Language · Computer Science
Interleaved Reasoning for Large Language Models via Reinforcement Learning
Roy Xie, David Qiu, Deepak Gopinath, Dong Lin +4
2026-01-08
Machine Learning · Computer Science
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
Yongcan Yu, Lingxiao He, Shuo Lu, Lijun Sheng +9
2025-12-16
Computation and Language · Computer Science
Enhancing the Reasoning Capabilities of Small Language Models via Solution Guidance Fine-Tuning
Jing Bi, Yuting Wu, Weiwei Xing, Zhenjie Wei
2024-12-16
Computation and Language · Computer Science
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
Jierun Chen, Tiezheng Yu, Haoli Bai, Lewei Yao +10
2025-07-11
Computation and Language · Computer Science
Through the Valley: Path to Effective Long CoT Training for Small Language Models
Renjie Luo, Jiaxi Li, Chen Huang, Wei Lu
2025-10-02
Computation and Language · Computer Science
Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
Xiangchi Yuan, Xiang Chen, Tong Yu, Dachuan Shi +3
2025-10-07
Artificial Intelligence · Computer Science
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
Xumeng Wen, Zihan Liu, Shun Zheng, Shengyu Ye +8
2025-10-03
Computation and Language · Computer Science
CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning
Wenqiao Zhu, Ji Liu, Rongjuncheng Zhang, Haipang Wu +1
2025-09-09
Computation and Language · Computer Science
The Art of Efficient Reasoning: Data, Reward, and Optimization
Taiqiang Wu, Zenan Xu, Bo Zhou, Ngai Wong
2026-03-23
Computer Vision and Pattern Recognition · Computer Science
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
Qi Wang, Yanrui Yu, Ye Yuan, Rui Mao +1
2025-10-15
Artificial Intelligence · Computer Science
Unveiling the Impact of Coding Data Instruction Fine-Tuning on Large Language Models Reasoning
Xinlu Zhang, Zhiyu Zoey Chen, Xi Ye, Xianjun Yang +3
2024-12-13
Artificial Intelligence · Computer Science
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
Yuexiang Zhai, Hao Bai, Zipeng Lin, Jiayi Pan +7
2024-10-10
Computation and Language · Computer Science
Rectifying LLM Thought from Lens of Optimization
Junnan Liu, Hongwei Liu, Songyang Zhang, Kai Chen
2026-04-09
Computer Vision and Pattern Recognition · Computer Science
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
Huajie Tan, Yuheng Ji, Xiaoshuai Hao, Xiansheng Chen +3
2025-10-07
Computation and Language · Computer Science
S3-CoT: Self-Sampled Succinct Reasoning Enables Efficient Chain-of-Thought LLMs
Yanrui Du, Sendong Zhao, Yibo Gao, Danyang Zhao +8
2026-02-03
Computation and Language · Computer Science
The Impact of Reasoning Step Length on Large Language Models
Mingyu Jin, Qinkai Yu, Dong Shu, Haiyan Zhao +4
2024-06-25
Computation and Language · Computer Science
Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning
Nathanaël Carraz Rakotonirina, Ren Pang, Neha Anna John, Michael Bohlke-Schneider +1
2026-01-07
Computation and Language · Computer Science
Rethinking Supervised Fine-Tuning: Emphasizing Key Answer Tokens for Improved LLM Accuracy
Xiaofeng Shi, Qian Kou, Yuduo Li, Hua Zhou
2025-12-25