如何学习一个有用的评论家?基于模型的动作梯度估计策略优化
人工智能
2020-10-23 v2 机器学习
机器学习
摘要
用于连续控制的确定性策略 actor-critic 算法通过将 actor 的动作代入 critic 并沿动作价值梯度上升来改进 actor,该梯度通过将 actor 的雅可比矩阵与 critic 关于输入动作的梯度相链式求得。然而,critic 通常仅被训练以准确预测期望回报,而期望回报本身对策略优化并无用处。本文中,我们提出 MAGE,一种基于模型的 actor-critic 算法,以策略梯度理论为基础,显式地学习动作价值梯度。MAGE 通过学到的动力学模型反向传播,在时序差分学习中计算梯度目标,从而得到专为策略改进定制的 critic。在一组 MuJoCo 连续控制任务上,我们展示了该算法相较于无模型与基于模型的 state-of-the-art 基线的效率。
引用
@article{arxiv.2004.14309,
title = {How to Learn a Useful Critic? Model-based Action-Gradient-Estimator Policy Optimization},
author = {Pierluca D'Oro and Wojciech Jaśkowski},
journal= {arXiv preprint arXiv:2004.14309},
year = {2020}
}