中文

利用状态-动作等价性的基于模型的强化学习

机器学习 2019-10-10 v1 人工智能 机器学习

摘要

在马尔可夫决策过程(MDP)的状态空间中利用等价性质已在多项研究中被探讨。本文研究强化学习(RL)设定中的等价结构,其中转移分布不再被假设为已知。我们提出MDP中各种状态-动作对的转移概率之间的相似性概念,其自然地定义了状态-动作空间中的等价结构。针对学习器预先知道底层结构的情况,我们给出了等价感知置信集。这些置信集被证明小于其对应的无等价感知对应物。在更具挑战性的未知等价结构情况下,我们提出一种称为ApproxEquivalence的算法,其旨在寻找(近似)等价结构,并利用近似等价定义置信集。为说明所提置信集的有效性,我们提出C-UCRL,作为无折扣MDP中UCRL2的自然改进。在已知等价结构的情况下,我们证明C-UCRL在任何具有S个状态、A个动作和C个类的互通MDP中,相较UCRL2在后悔界上改进了√SA/C倍,当C≪SA时这对应于巨大的改进。据我们所知,这是首篇在高效利用MDP中等价结构的RL情形下提供后悔界的工作。在未知等价结构情况下,我们通过数值实验表明,C-UCRL与ApproxEquivalence结合在遍历MDP中优于UCRL2。

关键词

引用

@article{arxiv.1910.04077,
  title  = {Model-Based Reinforcement Learning Exploiting State-Action Equivalence},
  author = {Mahsa Asadi and Mohammad Sadegh Talebi and Hippolyte Bourel and Odalric-Ambrym Maillard},
  journal= {arXiv preprint arXiv:1910.04077},
  year   = {2019}
}

备注

ACML 2019. Recipient of the Best Student Paper Award