Computation and Language · Computer Science
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
Qiyuan Liu, Hao Xu, Xuhong Chen, Wei Chen +2
2025-10-06
Computer Vision and Pattern Recognition · Computer Science
Parrot: Pareto-optimal Multi-Reward Reinforcement Learning Framework for Text-to-Image Generation
Seung Hyun Lee, Yinxiao Li, Junjie Ke, Innfarn Yoo +10
2024-07-16
Artificial Intelligence · Computer Science
RRO: LLM Agent Optimization Through Rising Reward Trajectories
Zilong Wang, Jingfeng Yang, Sreyashi Nag, Samarth Varshney +4
2025-05-28
Machine Learning · Computer Science
On Reinforcement Learning and Distribution Matching for Fine-Tuning Language Models with no Catastrophic Forgetting
Tomasz Korbak, Hady Elsahar, Germán Kruszewski, Marc Dymetman
2022-11-15
Machine Learning · Computer Science
Robust Multi-Objective Controlled Decoding of Large Language Models
Seongho Son, William Bankes, Sangwoong Yoon, Shyam Sundhar Ramesh +2
2026-02-17
Machine Learning · Computer Science
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
Quan Wei, Siliang Zeng, Chenliang Li, William Brown +7
2025-10-24
Computation and Language · Computer Science
MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimization
Yasaman Jafari, Dheeraj Mekala, Rose Yu, Taylor Berg-Kirkpatrick
2025-06-10
Computation and Language · Computer Science
Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning
Mathieu Rita, Florian Strub, Rahma Chaabouni, Paul Michel +2
2024-05-01
Computation and Language · Computer Science
Proof-RM: A Scalable and Generalizable Reward Model for Math Proof
Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang +6
2026-02-20
Computation and Language · Computer Science
Reward Difference Optimization For Sample Reweighting In Offline RLHF
Shiqi Wang, Zhengze Zhang, Rui Zhao, Fei Tan +1
2024-10-31
Computation and Language · Computer Science
Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning
Sara Rajaee, Rochelle Choenni, Ekaterina Shutova, Christof Monz
2025-09-22
Computation and Language · Computer Science
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
Shilin Xu, Yanwei Li, Rui Yang, Tao Zhang +8
2025-06-18
Machine Learning · Computer Science
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
Shengyang Sun, Yian Zhang, Alexander Bukharin, David Mosallanezhad +10
2025-02-11
Machine Learning · Computer Science
Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation
Pei-Chi Pan, Yingbin Liang, Sen Lin
2026-02-11
Artificial Intelligence · Computer Science
Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
Guanghao Zhou, Panjia Qiu, Cen Chen, Jie Wang +3
2025-05-22
Machine Learning · Computer Science
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
Sunghwan Kim, Dongjin Kang, Taeyoon Kwon, Hyungjoo Chae +2
2025-05-20
Machine Learning · Computer Science
Reducing the Probability of Undesirable Outputs in Language Models Using Probabilistic Inference
Stephen Zhao, Aidan Li, Rob Brekelmans, Roger Grosse
2025-10-27
Machine Learning · Computer Science
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
Shenao Zhang, Zhihan Liu, Boyi Liu, Yufeng Zhang +5
2025-05-13
Computation and Language · Computer Science
A Survey on Progress in LLM Alignment from the Perspective of Reward Design
Miaomiao Ji, Yanqiu Wu, Zhibin Wu, Shoujin Wang +3
2025-09-03
Artificial Intelligence · Computer Science
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
Gang Li, Yan Chen, Ming Lin, Tianbao Yang
2026-03-03
Machine Learning · Computer Science
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
Wei Xiong, Jiarui Yao, Yuhui Xu, Bo Pang +7
2025-06-13
Machine Learning · Statistics
From Data to Rewards: a Bilevel Optimization Perspective on Maximum Likelihood Estimation
Abdelhakim Benechehab, Gabriel Singer, Corentin Léger, Youssef Attia El Hili +4
2025-10-14
Machine Learning · Computer Science
LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs
Ang Li, Yifei Wang, Zhihang Yuan, Stefanie Jegelka +1
2025-10-21
Computation and Language · Computer Science
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
Chenglong Wang, Yang Gan, Hang Zhou, Chi Hu +9
2025-10-27