中文

KL学习:Kullback-Leibler控制问题的在线求解

最优化与控制 2012-02-17 v2 人工智能

摘要

我们引入了一种随机逼近方法,用于求解遍历性Kullback-Leibler控制问题。Kullback-Leibler控制问题是一个有限状态空间上的马尔可夫决策过程,其中控制代价与受控转移概率相对于非受控转移概率的Kullback-Leibler散度成正比。本文讨论的算法允许使用常微分方程(ODE)方法进行可靠的理论分析。在一项数值实验中,该算法在收敛速度方面显示出与幂方法和相关的Z学习算法相当的性能。它可作为求解马尔可夫决策问题的强化学习风格算法的基础。

关键词

引用

@article{arxiv.1112.1996,
  title  = {KL-learning: Online solution of Kullback-Leibler control problems},
  author = {Joris Bierkens and Bert Kappen},
  journal= {arXiv preprint arXiv:1112.1996},
  year   = {2012}
}