中文

无模型强化学习中的ω正则目标

计算机科学中的逻辑 2018-10-03 v1 机器学习 机器学习

摘要

我们给出了马尔可夫决策过程(MDPs)的 ω-正则目标无模型强化学习的首个解法。我们提出了一种从 ω-正则目标的几乎必然满足到几乎必然可达性问题的构造性归约,并将该技术推广至学习如何控制未知模型以最大化满足目标的概率。我们技术的一个关键特征是将 ω-正则性质编译为极限确定性 Büchi 自动机,而非传统的 Rabin 自动机;这一选择规避了此前提案中饱受困扰的困难。我们的方法允许我们应用无模型、现成的强化学习算法,从 MDP 的观测中计算最优策略。我们在一组基准学习问题上给出了该技术的实验评估。

关键词

引用

@article{arxiv.1810.00950,
  title  = {Omega-Regular Objectives in Model-Free Reinforcement Learning},
  author = {Ernst Moritz Hahn and Mateo Perez and Sven Schewe and Fabio Somenzi and Ashutosh Trivedi and Dominik Wojtczak},
  journal= {arXiv preprint arXiv:1810.00950},
  year   = {2018}
}

备注

16 pages, 3 figures