因子化马尔可夫决策过程中极小极大最优强化学习的研究
机器学习
2020-06-25 v1 最优化与控制
机器学习
摘要
我们研究情节式因子化马尔可夫决策过程(FMDPs)中的极小极大最优强化学习,FMDPs 是具有条件独立转移分量的 MDP。在假定因子结构已知的条件下,我们提出两种基于模型的算法。第一种对一类丰富的因子结构实现了极小极大最优后悔界,而第二种具有更好的计算复杂度但后悔稍差。我们算法的一个关键新要素是设计用于引导探索的奖励项(bonus term)。我们通过给出 FMDPs 上若干依赖于结构的后悔下界来补充我们的算法,这些下界揭示了隐藏在结构复杂性中的困难。
引用
@article{arxiv.2006.13405,
title = {Towards Minimax Optimal Reinforcement Learning in Factored Markov Decision Processes},
author = {Yi Tian and Jian Qian and Suvrit Sra},
journal= {arXiv preprint arXiv:2006.13405},
year = {2020}
}
备注
54 pages