中文

TOMA:面向强化学习的拓扑地图抽象

机器学习 2020-06-24 v2 人工智能 机器学习

摘要

动物能够发现周围环境的拓扑地图(图),并用于导航。受这一生物现象启发,研究者近期提出为马尔可夫决策过程(MDP)生成图表示,并将此类图用于强化学习(RL)中的规划。然而,现有图生成方法存在诸多缺陷。其一,现有方法未学习图的抽象,导致内存与计算成本高昂,且使生成的图缺乏鲁棒性,从而降低规划性能。其二,现有方法无法用于促进探索,而探索在 RL 中十分重要。本文提出一种名为拓扑地图抽象(TOMA)的新方法用于图生成。TOMA 能为 MDP 生成抽象图表示,其内存与计算开销远低于现有方法。此外,TOMA 可用于促进探索。具体而言,我们提出“规划以探索”,其中 TOMA 通过引导智能体走向未探索状态来加速探索。我们还提出一种称为顶点记忆(vertex memory)的新型经验回放模块以提升探索性能。实验结果表明,TOMA 优于现有方法,达到了最先进的性能。

关键词

引用

@article{arxiv.2005.06061,
  title  = {TOMA: Topological Map Abstraction for Reinforcement Learning},
  author = {Zhao-Heng Yin and Wu-Jun Li},
  journal= {arXiv preprint arXiv:2005.06061},
  year   = {2020}
}