Machine Learning · Computer Science
Partial Policy Gradients for RL in LLMs
Puneet Mathur, Branislav Kveton, Subhojyoti Mukherjee, Viet Dac Lai
2026-03-09
Computation and Language · Computer Science
On the Weaknesses of Reinforcement Learning for Neural Machine Translation
Leshem Choshen, Lior Fox, Zohar Aizenbud, Omri Abend
2020-01-16
Machine Learning · Computer Science
Optimization Methods for Interpretable Differentiable Decision Trees in Reinforcement Learning
Andrew Silva, Taylor Killian, Ivan Dario Jimenez Rodriguez, Sung-Hyun Son +1
2020-06-29
Machine Learning · Computer Science
Investigating the Impact of Action Representations in Policy Gradient Algorithms
Jan Schneider, Pierre Schumacher, Daniel Häufle, Bernhard Schölkopf +1
2023-09-14
Computation and Language · Computer Science
Neural Machine Translation with Adequacy-Oriented Learning
Xiang Kong, Zhaopeng Tu, Shuming Shi, Eduard Hovy +1
2018-11-22
Computation and Language · Computer Science
Natural Language Reinforcement Learning
Xidong Feng, Ziyu Wan, Mengyue Yang, Ziyan Wang +4
2024-02-16
Machine Learning · Computer Science
A Study of Reinforcement Learning for Neural Machine Translation
Lijun Wu, Fei Tian, Tao Qin, Jianhuang Lai +1
2018-08-28
Machine Learning · Computer Science
Reinforcement Learning with Promising Tokens for Large Language Models
Jing-Cheng Pang, Liang Lu, Xian Tang, Kun Jiang +3
2026-02-17
Artificial Intelligence · Computer Science
Navigating Noisy Feedback: Enhancing Reinforcement Learning with Error-Prone Language Models
Muhan Lin, Shuyang Shi, Yue Guo, Behdad Chalaki +5
2024-10-24
Artificial Intelligence · Computer Science
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
Siwei Wang, Yifei Shen, Haoran Sun, Shi Feng +4
2026-03-04
Computation and Language · Computer Science
Understanding Learning Dynamics for Neural Machine Translation
Conghui Zhu, Guanlin Li, Lemao Liu, Tiejun Zhao +1
2020-04-07
Machine Learning · Computer Science
Which Rewards Matter? Reward Selection for Reinforcement Learning under Limited Feedback
Shreyas Chaudhari, Renhao Zhang, Philip S. Thomas, Bruno Castro da Silva
2025-10-02
Computation and Language · Computer Science
Decoding and Diversity in Machine Translation
Nicholas Roberts, Davis Liang, Graham Neubig, Zachary C. Lipton
2020-11-30
Computation and Language · Computer Science
Diversity or Precision? A Deep Dive into Next Token Prediction
Haoyuan Wu, Hai Wang, Jiajia Wu, Jinxiang Ou +4
2026-03-17
Machine Learning · Computer Science
Identifying Policy Gradient Subspaces
Jan Schneider, Pierre Schumacher, Simon Guist, Le Chen +3
2024-03-19
Machine Learning · Computer Science
Learning to Reason at the Frontier of Learnability
Thomas Foster, Anya Sims, Johannes Forkel, Mattie Fellows +1
2026-05-01
Machine Learning · Computer Science
When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient
Shuning Shang, Hubert Strauss, Stanley Wei, Sanjeev Arora +1
2026-04-29
Machine Learning · Computer Science
Assessing the Impact of Distribution Shift on Reinforcement Learning Performance
Ted Fujimoto, Joshua Suetterlein, Samrat Chatterjee, Auroop Ganguly
2024-02-07