Dreaming:基于潜空间想象且无需重构的模型基强化学习
机器学习
2021-03-15 v2 人工智能
系统与控制
系统与控制
机器学习
摘要
在本文中,我们提出Dreamer(一种领先的基于像素的模型基强化学习(MBRL)方法)的无解码器扩展。Dreamer是一种样本高效且成本高效的机器人学习方案,因为它被用于基于变分自编码器训练潜状态空间模型,并通过潜轨迹想象进行策略优化。然而,这种基于自编码的方法常导致物体消失问题,即自编码器未能感知用于解决控制任务的关键物体,从而显著限制了Dreamer的潜力。本工作旨在通过移除解码器来缓解Dreamer的这一瓶颈并提升其性能。为此,我们首先由Dreamer的证据下界推导出对比学习的无似然InfoMax目标。其次,我们将两个组件,即(i)独立线性动力学与(ii)随机裁剪数据增强,纳入学习方案以改善训练性能。与Dreamer及其他近期无模型强化学习方法相比,我们新设计的带InfoMax且无生成解码器的Dreamer(Dreaming)在5个困难的模拟机器人任务上取得了最佳分数,而Dreamer在这些任务中受困于物体消失。
引用
@article{arxiv.2007.14535,
title = {Dreaming: Model-based Reinforcement Learning by Latent Imagination without Reconstruction},
author = {Masashi Okada and Tadahiro Taniguchi},
journal= {arXiv preprint arXiv:2007.14535},
year = {2021}
}
备注
Accepted to ICRA2021. Camera ready version