中文

无人类演示的障碍塔:深度前馈网络在强化学习中能走多远

机器学习 2020-07-21 v2 人工智能 机器学习

摘要

障碍塔挑战(Obstacle Tower Challenge)是一项掌握程序生成的关卡链的任务,这些关卡随后变得越来越难以完成。去年比赛中表现最优异的参赛方案使用了人类演示或奖励塑形来学习如何应对该挑战,而我们提出的方法具有竞争力(获得第7名),但通过深度强化学习和相对简单的前馈深度网络结构,完全从零开始。我们特别考察了所采用方法针对不同随机种子和比赛后可用的各种视觉主题的泛化性能,并探究了智能体在何处失败及其原因。请注意,我们的方法不具备像使用循环隐藏状态那样的短期记忆。通过这项工作,我们希望有助于更好地理解,一个相对简单、灵活的解决方案在具有复杂3D视觉输入但抽象任务结构本身仍相当简单的环境中,能够实现什么。

关键词

引用

@article{arxiv.2004.00567,
  title  = {Obstacle Tower Without Human Demonstrations: How Far a Deep Feed-Forward Network Goes with Reinforcement Learning},
  author = {Marco Pleines and Jenia Jitsev and Mike Preuss and Frank Zimmer},
  journal= {arXiv preprint arXiv:2004.00567},
  year   = {2020}
}

备注

8 pages, 9 figures, 2 tables, under review