中文

面向分支马尔可夫决策过程的无模型强化学习

机器学习 2021-06-15 v1 计算机科学中的逻辑 系统与控制 系统与控制

摘要

我们研究用于分支马尔可夫决策过程(BMDPs)最优控制的强化学习,BMDPs 是(多类型)分支马尔可夫链(BMCs)的自然推广。离散时间 BMCs 的状态是各类实体的集合,这些实体在生成其他实体的同时产生收益。与 BMCs 中同类型每个实体的演化遵循相同概率模式不同,BMDPs 允许外部控制器从一组选项中进行选择,这使得我们能够研究系统的最佳/最差行为。我们将无模型强化学习技术推广,以在极限下计算未知 BMDP 的最优控制策略。我们给出了实现的实验结果,证明了该方法的实用性。

关键词

引用

@article{arxiv.2106.06777,
  title  = {Model-free Reinforcement Learning for Branching Markov Decision Processes},
  author = {Ernst Moritz Hahn and Mateo Perez and Sven Schewe and Fabio Somenzi and Ashutosh Trivedi and Dominik Wojtczak},
  journal= {arXiv preprint arXiv:2106.06777},
  year   = {2021}
}

备注

to appear in CAV 2021