面向分支马尔可夫决策过程的无模型强化学习
机器学习
2021-06-15 v1 计算机科学中的逻辑
系统与控制
系统与控制
摘要
我们研究用于分支马尔可夫决策过程(BMDPs)最优控制的强化学习,BMDPs 是(多类型)分支马尔可夫链(BMCs)的自然推广。离散时间 BMCs 的状态是各类实体的集合,这些实体在生成其他实体的同时产生收益。与 BMCs 中同类型每个实体的演化遵循相同概率模式不同,BMDPs 允许外部控制器从一组选项中进行选择,这使得我们能够研究系统的最佳/最差行为。我们将无模型强化学习技术推广,以在极限下计算未知 BMDP 的最优控制策略。我们给出了实现的实验结果,证明了该方法的实用性。
关键词
引用
@article{arxiv.2106.06777,
title = {Model-free Reinforcement Learning for Branching Markov Decision Processes},
author = {Ernst Moritz Hahn and Mateo Perez and Sven Schewe and Fabio Somenzi and Ashutosh Trivedi and Dominik Wojtczak},
journal= {arXiv preprint arXiv:2106.06777},
year = {2021}
}
备注
to appear in CAV 2021