关于近端策略优化的重尾梯度
机器学习
2021-07-14 v2 机器人学
机器学习
摘要
现代策略梯度算法如近端策略优化(PPO)依赖一系列启发式技巧,包括损失裁剪与梯度裁剪,以确保学习成功。这些技巧令人联想到稳健统计中的技术,后者常用于离群值丰富(“重尾”)环境下的估计。本文提出一项详尽的实证研究,以刻画PPO替代奖励函数梯度的重尾特性。我们证明梯度(尤其是 actor 网络的梯度)表现出明显的重尾性,且随着智能体策略偏离行为策略(即智能体进一步偏离策略)而增强。进一步分析指出替代奖励中的似然比与优势函数是观测到重尾性的主要来源。随后我们强调了由梯度重尾性引发的问题。基于此,我们研究了标准PPO裁剪启发式技巧的效果,证明这些技巧主要用以抵消梯度中的重尾性。受此启发,我们提出将高维稳健估计器GMOM引入PPO,以替代三种裁剪技巧。尽管所需超参数调优更少,我们的方法在一系列MuJoCo连续控制任务上匹配了PPO(启用全部启发式)的性能。
引用
@article{arxiv.2102.10264,
title = {On Proximal Policy Optimization's Heavy-tailed Gradients},
author = {Saurabh Garg and Joshua Zhanson and Emilio Parisotto and Adarsh Prasad and J. Zico Kolter and Zachary C. Lipton and Sivaraman Balakrishnan and Ruslan Salakhutdinov and Pradeep Ravikumar},
journal= {arXiv preprint arXiv:2102.10264},
year = {2021}
}
备注
ICML 2021