中文

VariBAD:一种通过元学习实现贝叶斯自适应深度强化学习的极佳方法

机器学习 2020-03-02 v2 机器学习

摘要

在未知环境中权衡探索与利用,是学习期间最大化期望回报的关键。贝叶斯最优策略可最优地做到这一点,其动作不仅依赖于环境状态,还依赖于智能体对环境的不确定性。然而,除最小规模任务外,计算贝叶斯最优策略都是难解的。本文中,我们引入变分贝叶斯自适应深度强化学习(variBAD),一种元学习在未知环境中执行近似推断、并在动作选择时直接纳入任务不确定性的方法。在网格世界域中,我们阐释了 variBAD 如何作为任务不确定性的函数执行结构化在线探索。我们进一步在元强化学习广泛使用的 MuJoCo 域上评估 variBAD,表明其在线回报高于现有方法。

关键词

引用

@article{arxiv.1910.08348,
  title  = {VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning},
  author = {Luisa Zintgraf and Kyriacos Shiarlis and Maximilian Igl and Sebastian Schulze and Yarin Gal and Katja Hofmann and Shimon Whiteson},
  journal= {arXiv preprint arXiv:1910.08348},
  year   = {2020}
}

备注

Published at ICLR 2020