裁剪动作策略梯度
机器学习
2018-06-25 v2 人工智能
机器学习
摘要
许多连续控制任务具有有界动作空间。当将策略梯度方法应用于此类任务时,越界动作在执行前需要被裁剪,而策略通常却在未考虑动作被裁剪的情况下进行优化。我们提出了一种利用动作被裁剪这一知识来降低估计方差的策略梯度估计器。我们证明,我们命名为裁剪动作策略梯度(CAPG)的估计器是无偏的,并且比忽略动作边界的常规估计器具有更低的方差。实验结果表明,CAPG 通常优于常规估计器,表明它是用于连续控制任务的更好的策略梯度估计器。源代码可在 https://github.com/pfnet-research/capg 获取。
引用
@article{arxiv.1802.07564,
title = {Clipped Action Policy Gradient},
author = {Yasuhiro Fujita and Shin-ichi Maeda},
journal= {arXiv preprint arXiv:1802.07564},
year = {2018}
}
备注
Accepted at ICML 2018