Machine Learning · Computer Science
On the Linear convergence of Natural Policy Gradient Algorithm
Sajad Khodadadian, Prakirt Raj Jhunjhunwala, Sushil Mahavir Varma, Siva Theja Maguluri
2021-05-05
Machine Learning · Computer Science
Proximal Policy Optimization Algorithms
John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford +1
2017-08-29
Machine Learning · Computer Science
Stable Policy Optimization via Off-Policy Divergence Regularization
Ahmed Touati, Amy Zhang, Joelle Pineau, Pascal Vincent
2020-06-22
Machine Learning · Computer Science
Partial Policy Gradients for RL in LLMs
Puneet Mathur, Branislav Kveton, Subhojyoti Mukherjee, Viet Dac Lai
2026-03-09
Machine Learning · Computer Science
Learning to Constrain Policy Optimization with Virtual Trust Region
Hung Le, Thommen Karimpanal George, Majid Abdolshah, Dung Nguyen +3
2022-09-19
Machine Learning · Computer Science
Trust Region-Guided Proximal Policy Optimization
Yuhui Wang, Hao He, Xiaoyang Tan, Yaozhong Gan
2019-11-11
Machine Learning · Computer Science
Gradient Informed Proximal Policy Optimization
Sanghyun Son, Laura Yu Zheng, Ryan Sullivan, Yi-Ling Qiao +1
2023-12-15
Machine Learning · Computer Science
Trajectory-Based Off-Policy Deep Reinforcement Learning
Andreas Doerr, Michael Volpp, Marc Toussaint, Sebastian Trimpe +1
2019-05-15
Machine Learning · Computer Science
Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO
Logan Engstrom, Andrew Ilyas, Shibani Santurkar, Dimitris Tsipras +3
2020-05-27
Machine Learning · Computer Science
Reflective Policy Optimization
Yaozhong Gan, Renye Yan, Zhe Wu, Junliang Xing
2024-06-07
Machine Learning · Statistics
Fast Global Convergence of Natural Policy Gradient Methods with Entropy Regularization
Shicong Cen, Chen Cheng, Yuxin Chen, Yuting Wei +1
2022-09-13
Machine Learning · Computer Science
Truly Proximal Policy Optimization
Yuhui Wang, Hao He, Chao Wen, Xiaoyang Tan
2020-01-15
Machine Learning · Computer Science
Identifying Policy Gradient Subspaces
Jan Schneider, Pierre Schumacher, Simon Guist, Le Chen +3
2024-03-19
Machine Learning · Computer Science
Towards an Understanding of Default Policies in Multitask Policy Optimization
Ted Moskovitz, Michael Arbel, Jack Parker-Holder, Aldo Pacchiano
2022-03-24
Machine Learning · Computer Science
An Approximate Ascent Approach To Prove Convergence of PPO
Leif Doering, Daniel Schmidt, Moritz Melcher, Sebastian Kassing +3
2026-02-04