TOMA:面向强化学习的拓扑地图抽象
机器学习
2020-06-24 v2 人工智能
机器学习
摘要
动物能够发现周围环境的拓扑地图(图),并用于导航。受这一生物现象启发,研究者近期提出为马尔可夫决策过程(MDP)生成图表示,并将此类图用于强化学习(RL)中的规划。然而,现有图生成方法存在诸多缺陷。其一,现有方法未学习图的抽象,导致内存与计算成本高昂,且使生成的图缺乏鲁棒性,从而降低规划性能。其二,现有方法无法用于促进探索,而探索在 RL 中十分重要。本文提出一种名为拓扑地图抽象(TOMA)的新方法用于图生成。TOMA 能为 MDP 生成抽象图表示,其内存与计算开销远低于现有方法。此外,TOMA 可用于促进探索。具体而言,我们提出“规划以探索”,其中 TOMA 通过引导智能体走向未探索状态来加速探索。我们还提出一种称为顶点记忆(vertex memory)的新型经验回放模块以提升探索性能。实验结果表明,TOMA 优于现有方法,达到了最先进的性能。
引用
@article{arxiv.2005.06061,
title = {TOMA: Topological Map Abstraction for Reinforcement Learning},
author = {Zhao-Heng Yin and Wu-Jun Li},
journal= {arXiv preprint arXiv:2005.06061},
year = {2020}
}