中文

因子化马尔可夫决策过程中极小极大最优强化学习的研究

机器学习 2020-06-25 v1 最优化与控制 机器学习

摘要

我们研究情节式因子化马尔可夫决策过程(FMDPs)中的极小极大最优强化学习,FMDPs 是具有条件独立转移分量的 MDP。在假定因子结构已知的条件下,我们提出两种基于模型的算法。第一种对一类丰富的因子结构实现了极小极大最优后悔界,而第二种具有更好的计算复杂度但后悔稍差。我们算法的一个关键新要素是设计用于引导探索的奖励项(bonus term)。我们通过给出 FMDPs 上若干依赖于结构的后悔下界来补充我们的算法,这些下界揭示了隐藏在结构复杂性中的困难。

关键词

引用

@article{arxiv.2006.13405,
  title  = {Towards Minimax Optimal Reinforcement Learning in Factored Markov Decision Processes},
  author = {Yi Tian and Jian Qian and Suvrit Sra},
  journal= {arXiv preprint arXiv:2006.13405},
  year   = {2020}
}

备注

54 pages