中文

无限时域策略梯度估计实验

人工智能 2019-11-18 v2 机器学习

摘要

本文提出在部分可观测马尔可夫决策过程(POMDP)中执行平均奖励梯度上升的算法。这些算法基于 GPOMDP——一篇姊妹篇论文(Baxter and Bartlett,本卷)中引入的算法,该算法计算 POMDP 中性能梯度的有偏估计。该算法的主要优势在于:仅使用一个自由参数 beta,该参数在偏差-方差权衡方面具有自然的解释,无需了解底层状态,且可应用于无限状态、控制和观测空间。我们展示了如何利用 GPOMDP 产生的梯度估计来执行梯度上升,既可使用传统的随机梯度算法,也可使用基于共轭梯度的算法,该算法利用梯度信息在线搜索中界定极大值。实验结果展示了一个玩具问题上(Baxter and Bartlett,本卷)的理论结果,以及该算法在若干更现实问题上的实践层面。

关键词

引用

@article{arxiv.1106.0666,
  title  = {Experiments with Infinite-Horizon, Policy-Gradient Estimation},
  author = {J. Baxter and P. L. Bartlett and L. Weaver},
  journal= {arXiv preprint arXiv:1106.0666},
  year   = {2019}
}