基于随机网络蒸馏的探索
机器学习
2018-10-31 v1 人工智能
机器学习
摘要
我们为深度强化学习方法引入了一种易于实现且计算开销极小的探索奖励。该奖励由一个神经网络在给定固定随机初始化神经网络所提供的观测特征时的预测误差给出。我们还引入了一种灵活结合内在与外在奖励的方法。我们发现,随机网络蒸馏(RND)奖励结合这种增强的灵活性,在数个困难探索的 Atari 游戏上取得了显著进展。特别地,我们在 Montezuma's Revenge 上确立了最先进的性能,这是一款以对深度强化学习方法极难著称的游戏。据我们所知,这是首个在不使用演示或访问游戏底层状态的情况下,在该游戏上取得优于人类平均水平的性能,并偶尔通关第一关的方法。
引用
@article{arxiv.1810.12894,
title = {Exploration by Random Network Distillation},
author = {Yuri Burda and Harrison Edwards and Amos Storkey and Oleg Klimov},
journal= {arXiv preprint arXiv:1810.12894},
year = {2018}
}