VariBAD:一种通过元学习实现贝叶斯自适应深度强化学习的极佳方法
机器学习
2020-03-02 v2 机器学习
摘要
在未知环境中权衡探索与利用,是学习期间最大化期望回报的关键。贝叶斯最优策略可最优地做到这一点,其动作不仅依赖于环境状态,还依赖于智能体对环境的不确定性。然而,除最小规模任务外,计算贝叶斯最优策略都是难解的。本文中,我们引入变分贝叶斯自适应深度强化学习(variBAD),一种元学习在未知环境中执行近似推断、并在动作选择时直接纳入任务不确定性的方法。在网格世界域中,我们阐释了 variBAD 如何作为任务不确定性的函数执行结构化在线探索。我们进一步在元强化学习广泛使用的 MuJoCo 域上评估 variBAD,表明其在线回报高于现有方法。
引用
@article{arxiv.1910.08348,
title = {VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning},
author = {Luisa Zintgraf and Kyriacos Shiarlis and Maximilian Igl and Sebastian Schulze and Yarin Gal and Katja Hofmann and Shimon Whiteson},
journal= {arXiv preprint arXiv:1910.08348},
year = {2020}
}
备注
Published at ICLR 2020