中文

面向视频游戏的逆强化学习

机器学习 2018-10-26 v1 人工智能 机器学习

摘要

深度强化学习在一系列视频游戏环境中达到了超越人类的表现,但需要设计者手动指定奖励函数。提供目标行为的演示通常比设计描述该行为的奖励函数更容易。逆强化学习(IRL)算法能够在低维连续控制环境中从演示推断奖励,但将IRL应用于高维视频游戏的工作很少。在我们的CNN-AIRL基线中,我们修改了最先进的对抗式IRL(AIRL)算法,使生成器和判别器使用CNN。为了稳定训练,我们对奖励进行归一化并增大判别器训练数据集的规模。此外,我们使用一种为视频游戏环境调优的新型自编码器架构学习了低维状态表示。该嵌入被用作奖励网络的输入,提高了专家演示的样本效率。我们的方法在简单的Catcher视频游戏上达到了高水平表现,大幅优于CNN-AIRL基线。我们也在Enduro Atari赛车游戏上获得了分数,但未达到专家表现,这凸显了进一步研究的必要。

关键词

引用

@article{arxiv.1810.10593,
  title  = {Inverse reinforcement learning for video games},
  author = {Aaron Tucker and Adam Gleave and Stuart Russell},
  journal= {arXiv preprint arXiv:1810.10593},
  year   = {2018}
}

备注

10 pages, 4 figures. Submitted to NIPS Deep RL Workshop