从单次演示中学习蒙特祖玛的复仇
机器学习
2018-12-11 v1 人工智能
神经与进化计算
机器学习
摘要
我们提出一种从单次演示中学习以解决如Atari游戏蒙特祖玛的复仇这类困难探索任务的新方法。与其他近期工作所提议的模仿人类演示不同,我们的方法是直接最大化奖励。我们的智能体使用现成的强化学习进行训练,但每一回合都通过重置到演示中的某个状态开始。从此类演示状态出发,智能体学习一款游戏所需的探索远少于每回合都从游戏开头开始的情况。我们在一个简单玩具环境中分析了具有稀疏奖励任务的强化学习,其中表明标准RL方法的运行时间随奖励间状态数量呈指数级缩放。我们的方法将其降低为二次缩放,从而开辟了先前不可行的许多任务。随后我们将方法应用于蒙特祖玛的复仇,为此我们呈现了一个训练所得智能体,其取得74,500的高分,优于任何先前已发表的结果。
引用
@article{arxiv.1812.03381,
title = {Learning Montezuma's Revenge from a Single Demonstration},
author = {Tim Salimans and Richard Chen},
journal= {arXiv preprint arXiv:1812.03381},
year = {2018}
}
备注
Deep RL Workshop, NeurIPS 2018