中文

面向分层强化学习的抽象值迭代

机器学习 2021-02-26 v2

摘要

我们提出了一种用于连续状态与动作空间控制的新型分层强化学习框架。在我们的框架中,用户指定作为状态子集的子目标区域;随后,我们(i)学习充当这些子目标区域之间转移的 option,(ii)在所得到的抽象决策过程(ADP)中构建高层规划。一个关键挑战是 ADP 可能不满足马尔可夫性,我们通过提出两种在 ADP 中规划的算法来解决。我们的第一种算法是保守的,使我们能够证明其性能的理论保证,这有助于指导子目标区域的设计。我们的第二种算法是一种实用的算法,它将抽象层级的规划与具体层级的学习交织进行。在我们的实验中,我们证明了我们的方法在多个具有挑战性的基准上优于最先进的分层强化学习算法。

关键词

引用

@article{arxiv.2010.15638,
  title  = {Abstract Value Iteration for Hierarchical Reinforcement Learning},
  author = {Kishor Jothimurugan and Osbert Bastani and Rajeev Alur},
  journal= {arXiv preprint arXiv:2010.15638},
  year   = {2021}
}