Computation and Language · Computer Science
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang +1
2026-04-02
Artificial Intelligence · Computer Science
Counterfactual Explanation Policies in RL
Shripad V. Deshmukh, Srivatsan R, Supriti Vijay, Jayakumar Subramanian +1
2023-07-26
Machine Learning · Computer Science
Large Reasoning Models Learn Better Alignment from Flawed Thinking
ShengYun Peng, Eric Smith, Ivan Evtimov, Song Jiang +6
2026-04-13
Machine Learning · Computer Science
Safe Reinforcement Learning with Free-form Natural Language Constraints and Pre-Trained Language Models
Xingzhou Lou, Junge Zhang, Ziyan Wang, Kaiqi Huang +1
2024-05-16
Artificial Intelligence · Computer Science
Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
Guanghao Zhou, Panjia Qiu, Cen Chen, Jie Wang +3
2025-05-22
Computation and Language · Computer Science
Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle
Keliang Liu, Dingkang Yang, Ziyun Qian, Weijie Yin +6
2025-09-23
Computation and Language · Computer Science
Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning
Ang Li, Yichuan Mo, Mingjie Li, Yifei Wang +1
2025-02-24
Artificial Intelligence · Computer Science
Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning
Chang Tian, Matthew B. Blaschko, Mingzhe Xing, Xiuxing Li +2
2025-08-08
Machine Learning · Computer Science
Improving RL Exploration for LLM Reasoning through Retrospective Replay
Shihan Dou, Muling Wu, Jingwen Xu, Rui Zheng +3
2025-07-08
Machine Learning · Computer Science
Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning
Jingyao Wang, Peizheng Guo, Wenwen Qiang, Jiahuan Zhou +3
2026-05-14
Computation and Language · Computer Science
Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
Shulin Huang, Yiran Ding, Junshu Pan, Yue Zhang
2025-09-30
Machine Learning · Computer Science
Behavior Injection: Preparing Language Models for Reinforcement Learning
Zhepeng Cen, Yihang Yao, William Han, Zuxin Liu +1
2025-10-07
Computation and Language · Computer Science
Does Using Counterfactual Help LLMs Explain Textual Importance in Classification?
Nelvin Tan, James Asikin Cheung, Yu-Ching Shih, Dong Yang +1
2025-10-07
Artificial Intelligence · Computer Science
Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
Qianxi He, Qingyu Ren, Shanzhe Lei, Xuhong Wang +1
2025-11-12
Computation and Language · Computer Science
Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning
Wenbin Hu, Haoran Li, Huihao Jing, Qi Hu +6
2025-09-05
Machine Learning · Computer Science
GANterfactual-RL: Understanding Reinforcement Learning Agents' Strategies through Visual Counterfactual Explanations
Tobias Huber, Maximilian Demmler, Silvan Mertes, Matthew L. Olson +1
2023-02-27