经典策略梯度:保持 Bellman 最优性原理
机器学习
2019-06-10 v1 机器学习
摘要
针对有限时域 episodic 马尔可夫决策过程,我们提出了一种新的目标函数,其更好地体现了 Bellman 最优性原理,并给出了该目标函数梯度的表达式。
引用
@article{arxiv.1906.03063,
title = {Classical Policy Gradient: Preserving Bellman's Principle of Optimality},
author = {Philip S. Thomas and Scott M. Jordan and Yash Chandak and Chris Nota and James Kostas},
journal= {arXiv preprint arXiv:1906.03063},
year = {2019}
}
备注
1 page, 0 figures