中文

基于图的状态表示用于深度强化学习

机器学习 2021-02-17 v3 机器学习

摘要

深度强化学习(RL)方法的成功很大程度上建立在深度神经网络生成有用内部表示的能力之上。然而,它们存在较高的样本复杂度,而从一个良好的输入表示出发会对性能产生显著影响。在本文中,我们利用底层马尔可夫决策过程(MDP)构成一个图这一事实,从而能够将拓扑信息纳入有效的状态表示学习。受节点表示在若干图分析任务中近期成功的启发,我们具体考察了节点表示学习方法在深度RL中对底层MDP拓扑进行有效编码的能力。为此,我们对选自4类不同表示学习算法的若干模型在网格世界导航任务中的策略学习进行了比较分析,该类任务代表了很大一类RL问题。我们发现,在所有研究案例中,所有嵌入方法都优于常用的网格世界环境的矩阵表示。此外,基于图卷积的方法被更简单的基于随机游走的方法和图线性自编码器所超越。

关键词

引用

@article{arxiv.2004.13965,
  title  = {Graph-based State Representation for Deep Reinforcement Learning},
  author = {Vikram Waradpande and Daniel Kudenko and Megha Khosla},
  journal= {arXiv preprint arXiv:2004.13965},
  year   = {2021}
}