中文

具有弱导数的约束马尔可夫决策过程实时强化学习

最优化与控制 2018-12-18 v3

摘要

我们提出了用于计算约束、平均成本、有限状态马尔可夫决策过程局部最优策略的在线策略梯度算法。随机逼近算法需要估计成本函数相对于表征随机策略的参数的梯度。我们提出了一种球坐标参数化,并提出了一种涉及弱导数(测度值微分)的新型基于模拟的梯度估计方案。与广泛使用的得分函数方法相比,此类方法的方差显著降低。类似于神经动态规划算法(例如 Q-learning 或时序差分方法),本文提出的算法是基于模拟的,不需要显式知道底层参数(如转移概率)。然而,与神经动态规划方法不同,此处提出的算法可以处理约束和时变参数。给出了数值示例以说明算法的性能。本文最初写于 2004 年。我们现在将其发布在 arXiv 上的一个原因是,得分函数梯度估计器继续在在线强化学习文献中被使用,尽管给定 nn 个数据点(对于马尔可夫过程),其方差随 O(n)O(n) 增长。相比之下,如本文(及其他地方)所报道,弱导数估计器的方差显著更小,为 O(1)O(1)

关键词

引用

@article{arxiv.1110.4946,
  title  = {Real-Time Reinforcement Learning of Constrained Markov Decision Processes with Weak Derivatives},
  author = {Vikram Krishnamurthy and Felisa Vazquez Abad},
  journal= {arXiv preprint arXiv:1110.4946},
  year   = {2018}
}