基于函数近似与动作依赖基线的强化学习策略梯度方法
人工智能
2017-06-22 v1 机器学习
摘要
我们展示了策略梯度定理如何利用函数近似来使用动作依赖基线,该定理最初由 (Sutton et al. 2000) 以动作独立基线提出。
引用
@article{arxiv.1706.06643,
title = {Policy Gradient Methods for Reinforcement Learning with Function Approximation and Action-Dependent Baselines},
author = {Philip S. Thomas and Emma Brunskill},
journal= {arXiv preprint arXiv:1706.06643},
year = {2017}
}