中文

非互通马尔可夫决策过程中的近最优探索-利用

机器学习 2019-03-21 v2 机器学习

摘要

在设计 MDP 的状态空间时,常常会包含瞬态或任何策略都无法到达的状态(例如,在山车问题中,速度与位置的乘积空间包含物理上无法达到的构型)。这导致定义弱互通或多链 MDP。在本文中,我们提出 \tucrl,这是首个能够在任意有限马尔可夫决策过程(MDP)中执行高效探索-利用而无需任何形式先验知识的算法。特别地,对于任意具有 SCS^{\texttt{C}} 个互通状态、AA 个动作以及 ΓCSC\Gamma^{\texttt{C}} \leq S^{\texttt{C}} 个可能的互通下一状态的 MDP,我们推导出 O~(DCΓCSCAT)\widetilde{O}(D^{\texttt{C}} \sqrt{\Gamma^{\texttt{C}} S^{\texttt{C}} AT}) 的遗憾界,其中 DCD^{\texttt{C}} 是 MDP 互通部分的直径(即最长最短路径)。这与在弱互通 MDP 中遭受线性遗憾的乐观算法(例如 UCRL、Optimistic PSRL)形成对比,也与后验采样或正则化算法(例如 REGAL)形成对比,后者需要关于最优策略偏差跨度的先验知识来偏置探索以取得次线性遗憾。我们还证明,在弱互通 MDP 中,任何算法都不可能在不先遭受步数呈 MDP 参数指数级的线性遗憾的情况下实现遗憾的对数增长。最后,我们报告了支持理论发现并展示 TUCRL 如何克服最先进方法局限性的数值模拟。

关键词

引用

@article{arxiv.1807.02373,
  title  = {Near Optimal Exploration-Exploitation in Non-Communicating Markov Decision Processes},
  author = {Ronan Fruit and Matteo Pirotta and Alessandro Lazaric},
  journal= {arXiv preprint arXiv:1807.02373},
  year   = {2019}
}