Machine Learning · Computer Science
RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
Shreyas Chaudhari, Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit +4
2024-04-17
Machine Learning · Computer Science
Interpreting Learned Feedback Patterns in Large Language Models
Luke Marks, Amir Abdullah, Clement Neo, Rauno Arike +3
2025-09-22
Artificial Intelligence · Computer Science
Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback
Stephen Casper, Xander Davies, Claudia Shi, Thomas Krendl Gilbert +28
2023-09-12
Machine Learning · Computer Science
Teaching Large Language Models to Reason with Reinforcement Learning
Alex Havrilla, Yuqing Du, Sharath Chandra Raparthy, Christoforos Nalmpantis +5
2024-03-08
Audio and Speech Processing · Electrical Eng. & Systems
Speech Recognition With LLMs Adapted to Disordered Speech Using Reinforcement Learning
Chirag Nagpal, Subhashini Venugopalan, Jimmy Tobin, Marilyn Ladewig +2
2025-01-03
Computation and Language · Computer Science
Aligning Large Language Models with Human Preferences through Representation Engineering
Wenhao Liu, Xiaohua Wang, Muling Wu, Tianlong Li +6
2024-07-04
Machine Learning · Computer Science
Efficient RLHF: Reducing the Memory Usage of PPO
Michael Santacroce, Yadong Lu, Han Yu, Yuanzhi Li +1
2023-09-06
Computation and Language · Computer Science
Fine-tuning Language Models with Generative Adversarial Reward Modelling
Zhang Ze Yu, Lau Jia Jaw, Zhang Hui, Bryan Kian Hsiang Low
2024-03-06
Machine Learning · Computer Science
A Survey of Reinforcement Learning from Human Feedback
Timo Kaufmann, Paul Weng, Viktor Bengs, Eyke Hüllermeier
2025-12-30
Computation and Language · Computer Science
Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
Hao Sun, Yunyi Shen, Jean-Francois Ton, Mihaela van der Schaar
2025-02-10
Computation and Language · Computer Science
HFT: Half Fine-Tuning for Large Language Models
Tingfeng Hui, Zhenyu Zhang, Shuohuan Wang, Weiran Xu +2
2024-04-30
Computation and Language · Computer Science
MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions
Yekun Chai, Haoran Sun, Huang Fang, Shuohuan Wang +2
2025-02-18
Computation and Language · Computer Science
A Long Way to Go: Investigating Length Correlations in RLHF
Prasann Singhal, Tanya Goyal, Jiacheng Xu, Greg Durrett
2024-07-12
Machine Learning · Computer Science
RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods
Raghav Sharma, Manan Mehta, Sai Tiger Raina
2025-11-07
Computation and Language · Computer Science
Removing RLHF Protections in GPT-4 via Fine-Tuning
Qiusi Zhan, Richard Fang, Rohan Bindu, Akul Gupta +2
2024-04-09
Computation and Language · Computer Science
RLTHF: Targeted Human Feedback for LLM Alignment
Yifei Xu, Tusher Chakraborty, Emre Kıcıman, Bibek Aryal +10
2025-08-08
Computation and Language · Computer Science
Enhancing Reinforcement Learning with Label-Sensitive Reward for Natural Language Understanding
Kuo Liao, Shuang Li, Meng Zhao, Liqun Liu +4
2024-05-31
Machine Learning · Computer Science
Parameter Efficient Reinforcement Learning from Human Feedback
Hakim Sidahmed, Samrat Phatale, Alex Hutcheson, Zhuonan Lin +15
2024-09-16