中文

经典策略梯度:保持 Bellman 最优性原理

机器学习 2019-06-10 v1 机器学习

摘要

针对有限时域 episodic 马尔可夫决策过程,我们提出了一种新的目标函数,其更好地体现了 Bellman 最优性原理,并给出了该目标函数梯度的表达式。

关键词

引用

@article{arxiv.1906.03063,
  title  = {Classical Policy Gradient: Preserving Bellman's Principle of Optimality},
  author = {Philip S. Thomas and Scott M. Jordan and Yash Chandak and Chris Nota and James Kostas},
  journal= {arXiv preprint arXiv:1906.03063},
  year   = {2019}
}

备注

1 page, 0 figures