VASE:用于强化学习的变分多样惊喜探索
机器学习
2019-11-01 v1 机器学习
摘要
在具有连续控制与稀疏奖励的环境中进行探索仍是强化学习(RL)中的关键挑战。近来,惊喜被用作一种内在奖励,以鼓励系统且高效的探索。我们引入了一种新的惊喜定义及其 RL 实现,称为变分多样惊喜探索(VASE)。VASE 使用贝叶斯神经网络作为环境动态的模型,并通过变分推断进行训练,交替更新智能体模型与策略的准确性。我们的实验表明,在连续控制稀疏奖励环境中,VASE 优于其他基于惊喜的探索技术。
引用
@article{arxiv.1910.14351,
title = {VASE: Variational Assorted Surprise Exploration for Reinforcement Learning},
author = {Haitao Xu and Brendan McCane and Lech Szymanski},
journal= {arXiv preprint arXiv:1910.14351},
year = {2019}
}