中文

基于函数近似与动作依赖基线的强化学习策略梯度方法

人工智能 2017-06-22 v1 机器学习

摘要

我们展示了策略梯度定理如何利用函数近似来使用动作依赖基线,该定理最初由 (Sutton et al. 2000) 以动作独立基线提出。

关键词

引用

@article{arxiv.1706.06643,
  title  = {Policy Gradient Methods for Reinforcement Learning with Function Approximation and Action-Dependent Baselines},
  author = {Philip S. Thomas and Emma Brunskill},
  journal= {arXiv preprint arXiv:1706.06643},
  year   = {2017}
}