通过结合路径梯度与得分函数估计器实现离散动作空间的确定性策略优化
人工智能
2017-11-23 v1 机器学习
摘要
策略优化方法在解决复杂强化学习与模仿学习任务中已展现出巨大前景。无模型方法虽广泛适用,但常需大量样本来优化复杂策略。基于模型的方法大幅提升了样本效率,却以泛化能力差为代价,且需针对每个任务精心手工构建系统动力学模型。近来,混合方法在适用性与样本复杂度之间取得了良好折中。然而,这些方法仅限于连续动作空间。本文提出一种基于动力学近似的新混合方法,将该近似表示为当前策略下对下一状态的期望。这一松弛使我们推导出一种新的混合策略梯度估计器,它结合了得分函数与路径导数估计器,可适用于离散动作空间。我们在 Cart Pole、Acrobot、Mountain Car 和 Hand Mass 上学习参数化策略时,展示了样本复杂度上 1.7 至 25 倍的显著提升。我们的方法同时适用于离散与连续动作空间,而与之竞争的路径方法仅局限于后者。
引用
@article{arxiv.1711.08068,
title = {Deterministic Policy Optimization by Combining Pathwise and Score Function Estimators for Discrete Action Spaces},
author = {Daniel Levy and Stefano Ermon},
journal= {arXiv preprint arXiv:1711.08068},
year = {2017}
}
备注
In AAAI 2018 proceedings