中文

Dreaming:基于潜空间想象且无需重构的模型基强化学习

机器学习 2021-03-15 v2 人工智能 系统与控制 系统与控制 机器学习

摘要

在本文中,我们提出Dreamer(一种领先的基于像素的模型基强化学习(MBRL)方法)的无解码器扩展。Dreamer是一种样本高效且成本高效的机器人学习方案,因为它被用于基于变分自编码器训练潜状态空间模型,并通过潜轨迹想象进行策略优化。然而,这种基于自编码的方法常导致物体消失问题,即自编码器未能感知用于解决控制任务的关键物体,从而显著限制了Dreamer的潜力。本工作旨在通过移除解码器来缓解Dreamer的这一瓶颈并提升其性能。为此,我们首先由Dreamer的证据下界推导出对比学习的无似然InfoMax目标。其次,我们将两个组件,即(i)独立线性动力学与(ii)随机裁剪数据增强,纳入学习方案以改善训练性能。与Dreamer及其他近期无模型强化学习方法相比,我们新设计的带InfoMax且无生成解码器的Dreamer(Dreaming)在5个困难的模拟机器人任务上取得了最佳分数,而Dreamer在这些任务中受困于物体消失。

关键词

引用

@article{arxiv.2007.14535,
  title  = {Dreaming: Model-based Reinforcement Learning by Latent Imagination without Reconstruction},
  author = {Masashi Okada and Tadahiro Taniguchi},
  journal= {arXiv preprint arXiv:2007.14535},
  year   = {2021}
}

备注

Accepted to ICRA2021. Camera ready version