贝叶斯者的 PlaNet:通过引入贝叶斯推断重新考量并改进深度规划网络
机器学习
2020-03-03 v1 神经与进化计算
机器人学
机器学习
摘要
在本文中,我们提出深度规划网络(PlaNet)的一个扩展,也称为贝叶斯者的 PlaNet(PlaNet-Bayes)。在部分可观测环境中,由于例如缺乏昂贵传感器导致完整信息不可用,对模型预测控制(MPC)的需求日益增长。PlaNet 是实现此类隐空间 MPC 的一个有前景的方案,因为它用于通过基于模型的强化学习(MBRL)训练状态空间模型,并在隐空间中进行规划。然而,MBRR 文献中提到的近期最先进策略,例如将不确定性纳入训练与规划,尚未被考虑,这显著抑制了训练性能。所提出的扩展是使 PlaNet 基于贝叶斯推断具有不确定性感知,其中融入了模型与动作的不确定性。隐模型中的不确定性使用神经网络集成来表示,以近似推断模型后验。最优动作候选的集成也被用来捕获最优性中的多模态不确定性。动作集成的概念依赖于一个通用的变分推断 MPC(VI-MPC)框架及其实例——带轨迹采样的概率动作集成(PaETS)。在本文中,我们扩展了先前文献中引入的 VI-MPC 和 PaETS,以处理部分可观测情况。我们在连续控制任务上实验比较了性能,并得出结论:与 PlaNet 相比,我们的方法能持续提高渐近性能。
引用
@article{arxiv.2003.00370,
title = {PlaNet of the Bayesians: Reconsidering and Improving Deep Planning Network by Incorporating Bayesian Inference},
author = {Masashi Okada and Norio Kosaka and Tadahiro Taniguchi},
journal= {arXiv preprint arXiv:2003.00370},
year = {2020}
}