中文

利用卷积神经网络扩展强化学习中的全目标更新

机器学习 2020-02-06 v2 机器学习

摘要

能够到达环境中任意期望位置对智能体而言是一项宝贵能力。逐一学习在 all pairs of states 间导航的策略通常不可行。全目标更新算法利用每次转移同时、离策略地学习朝向所有目标的Q值。然而,并行进行的大量昂贵更新迄今将该方法局限于小型表格情形。为解决此问题,我们提出使用卷积网络架构一次性生成大量目标的Q值与更新。我们在随机生成的迷宫和推箱子(Sokoban)谜题上展示了所提方法的准确性与泛化特性。在屏幕目标坐标情形下,从帧到距离图的映射直接告知智能体哪些位置可达以及需要多少步。作为应用示例,我们展示在ϵ\epsilon-贪婪探索中用若干朝向可行目标的动作替换随机动作,可在Montezuma's Revenge和Super Mario All-Stars游戏中生成更好的探索轨迹。

关键词

引用

@article{arxiv.1810.02927,
  title  = {Scaling All-Goals Updates in Reinforcement Learning Using Convolutional Neural Networks},
  author = {Fabio Pardo and Vitaly Levdik and Petar Kormushev},
  journal= {arXiv preprint arXiv:1810.02927},
  year   = {2020}
}

备注

AAAI 2020, https://sites.google.com/view/q-map-rl