无模型强化学习中的ω正则目标
计算机科学中的逻辑
2018-10-03 v1 机器学习
机器学习
摘要
我们给出了马尔可夫决策过程(MDPs)的 ω-正则目标无模型强化学习的首个解法。我们提出了一种从 ω-正则目标的几乎必然满足到几乎必然可达性问题的构造性归约,并将该技术推广至学习如何控制未知模型以最大化满足目标的概率。我们技术的一个关键特征是将 ω-正则性质编译为极限确定性 Büchi 自动机,而非传统的 Rabin 自动机;这一选择规避了此前提案中饱受困扰的困难。我们的方法允许我们应用无模型、现成的强化学习算法,从 MDP 的观测中计算最优策略。我们在一组基准学习问题上给出了该技术的实验评估。
引用
@article{arxiv.1810.00950,
title = {Omega-Regular Objectives in Model-Free Reinforcement Learning},
author = {Ernst Moritz Hahn and Mateo Perez and Sven Schewe and Fabio Somenzi and Ashutosh Trivedi and Dominik Wojtczak},
journal= {arXiv preprint arXiv:1810.00950},
year = {2018}
}
备注
16 pages, 3 figures