深入审视深度策略梯度
机器学习
2020-05-26 v4 神经与进化计算
机器人学
机器学习
摘要
我们研究深度策略梯度算法的行为如何反映其发展所依据的概念框架。为此,我们基于该框架的关键要素:梯度估计、价值预测和优化景观,对最先进的方法提出细粒度分析。我们的结果表明,深度策略梯度算法的行为常常偏离其概念框架的预测:替代目标与真实奖励景观不匹配,学到的价值估计器无法拟合真实价值函数,且梯度估计与“真实”梯度相关性很差。我们揭示的预测行为与经验行为之间的不匹配凸显了我们对当前方法的浅薄理解,并指出需要超越当前以基准为中心的评估方法。
引用
@article{arxiv.1811.02553,
title = {A Closer Look at Deep Policy Gradients},
author = {Andrew Ilyas and Logan Engstrom and Shibani Santurkar and Dimitris Tsipras and Firdaus Janoos and Larry Rudolph and Aleksander Madry},
journal= {arXiv preprint arXiv:1811.02553},
year = {2020}
}
备注
ICLR 2020 version