用于强化学习环境的梦境变分自编码器
机器学习
2018-10-04 v1 人工智能
摘要
强化学习在仅使用单一神经网络进行价值优化以泛化原始感官数据方面已展现出巨大潜力。当前最先进的强化学习算法存在若干挑战,阻碍其收敛至全局最优。这些问题的解决方案很可能在于强化学习算法的短期与长期规划、探索以及记忆管理。游戏常被用于基准测试强化学习算法,因为其提供了灵活、可复现且易于控制的环境。然而,很少有游戏具备这样一种状态空间:其中探索、记忆与规划的结果易于被感知。本文提出梦境变分自编码器(DVAE),一种基于神经网络的生成建模架构,用于稀疏反馈环境中的探索。我们进一步提出 Deep Maze,一种新颖且灵活的迷宫引擎,在部分与完全可观测状态空间、长视野任务以及确定性与随机性问题中对 DVAE 提出挑战。我们展示了初步发现,并鼓励在生成式探索驱动的强化学习方面开展进一步工作。
引用
@article{arxiv.1810.01112,
title = {The Dreaming Variational Autoencoder for Reinforcement Learning Environments},
author = {Per-Arne Andersen and Morten Goodwin and Ole-Christoffer Granmo},
journal= {arXiv preprint arXiv:1810.01112},
year = {2018}
}
备注
Best Student Paper Award, Proceedings of the 38th SGAI International Conference on Artificial Intelligence, Cambridge, UK, 2018, Artificial Intelligence XXXV, 2018