中文

基于弱导数的策略梯度在强化学习中的应用

机器学习 2020-04-13 v1 多智能体系统 系统与控制 系统与控制 最优化与控制 机器学习

摘要

本文研究连续状态-动作强化学习问题中的策略搜索。通常,人们使用称为策略梯度定理的策略梯度经典表达式计算搜索方向,该定理将价值函数的梯度分解为两个因子:得分函数与 Q 函数。本文给出四个结果:(i) 建立了使用弱(测度值)导数替代得分函数的另一种策略梯度定理;(ii) 所导出的随机梯度估计被证明是无偏的,并 yielding 几乎必然收敛到强化学习问题非凸价值函数驻点的算法;(iii) 推导了算法的样本复杂度,并证明其为 O(1/(k))O(1/\sqrt(k));(iv) 最后,使用弱导数获得的梯度估计的期望方差被证明低于使用流行的得分函数方法获得的估计。在 OpenAI gym 倒立摆环境中的实验显示了所提算法的优越性能。

关键词

引用

@article{arxiv.2004.04843,
  title  = {Policy Gradient using Weak Derivatives for Reinforcement Learning},
  author = {Sujay Bhatt and Alec Koppel and Vikram Krishnamurthy},
  journal= {arXiv preprint arXiv:2004.04843},
  year   = {2020}
}

备注

1 figure