中文

VASE:用于强化学习的变分多样惊喜探索

机器学习 2019-11-01 v1 机器学习

摘要

在具有连续控制与稀疏奖励的环境中进行探索仍是强化学习(RL)中的关键挑战。近来,惊喜被用作一种内在奖励,以鼓励系统且高效的探索。我们引入了一种新的惊喜定义及其 RL 实现,称为变分多样惊喜探索(VASE)。VASE 使用贝叶斯神经网络作为环境动态的模型,并通过变分推断进行训练,交替更新智能体模型与策略的准确性。我们的实验表明,在连续控制稀疏奖励环境中,VASE 优于其他基于惊喜的探索技术。

关键词

引用

@article{arxiv.1910.14351,
  title  = {VASE: Variational Assorted Surprise Exploration for Reinforcement Learning},
  author = {Haitao Xu and Brendan McCane and Lech Szymanski},
  journal= {arXiv preprint arXiv:1910.14351},
  year   = {2019}
}