Computation and Language · Computer Science
A fine-grained comparison of pragmatic language understanding in humans and language models
Jennifer Hu, Sammy Floyd, Olessia Jouravlev, Evelina Fedorenko +1
2023-05-25
Machine Learning · Computer Science
RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
Shreyas Chaudhari, Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit +4
2024-04-17
Artificial Intelligence · Computer Science
Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson +1
2026-02-03
Machine Learning · Computer Science
Interpreting Learned Feedback Patterns in Large Language Models
Luke Marks, Amir Abdullah, Clement Neo, Rauno Arike +3
2025-09-22
Computation and Language · Computer Science
Evaluating statistical language models as pragmatic reasoners
Benjamin Lipkin, Lionel Wong, Gabriel Grand, Joshua B Tenenbaum
2023-05-03
Computation and Language · Computer Science
BabyStories: Can Reinforcement Learning Teach Baby Language Models to Write Better Stories?
Xingmeng Zhao, Tongnian Wang, Sheri Osborn, Anthony Rios
2023-10-26
Computation and Language · Computer Science
Perceptions of Linguistic Uncertainty by Language Models and Humans
Catarina G Belem, Markelle Kelly, Mark Steyvers, Sameer Singh +1
2024-11-08
Machine Learning · Computer Science
Teaching Large Language Models to Reason with Reinforcement Learning
Alex Havrilla, Yuqing Du, Sharath Chandra Raparthy, Christoforos Nalmpantis +5
2024-03-08
Computation and Language · Computer Science
Towards Developmentally Plausible Rewards: Communicative Success as a Learning Signal for Interactive Language Models
Lennart Stöpler, Rufat Asadli, Mitja Nikolaus, Ryan Cotterell +1
2025-05-12
Machine Learning · Computer Science
Language Model Personalization via Reward Factorization
Idan Shenfeld, Felix Faltings, Pulkit Agrawal, Aldo Pacchiano
2025-03-11
Artificial Intelligence · Computer Science
Secrets of RLHF in Large Language Models Part II: Reward Modeling
Binghai Wang, Rui Zheng, Lu Chen, Yan Liu +23
2024-01-15
Computation and Language · Computer Science
Shattering the Agent-Environment Interface for Fine-Tuning Inclusive Language Models
Wanqiao Xu, Shi Dong, Dilip Arumugam, Benjamin Van Roy
2023-05-22
Artificial Intelligence · Computer Science
Towards a more flexible Language of Thought: Bayesian grammar updates after each concept exposure
Pablo Tano, Sergio Romano, Mariano Sigman, Alejo Salles +1
2020-04-29
Machine Learning · Statistics
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
Kai Ye, Hongyi Zhou, Jin Zhu, Francesco Quinzan +1
2026-02-11
Computation and Language · Computer Science
The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models
Kefan Yu, Qingcheng Zeng, Weihao Xuan, Wanxin Li +2
2026-01-13
Computation and Language · Computer Science
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
Yanjun Chen, Dawei Zhu, Yirong Sun, Xinghao Chen +2
2024-10-17
Computation and Language · Computer Science
Define, Evaluate, and Improve Task-Oriented Cognitive Capabilities for Instruction Generation Models
Lingjun Zhao, Khanh Nguyen, Hal Daumé
2023-05-30
Artificial Intelligence · Computer Science
Navigating Noisy Feedback: Enhancing Reinforcement Learning with Error-Prone Language Models
Muhan Lin, Shuyang Shi, Yue Guo, Behdad Chalaki +5
2024-10-24