中文

基于潜空间模型的离线图像强化学习

机器学习 2020-12-22 v1 人工智能 机器人学

摘要

离线强化学习(RL)是指从环境交互的静态数据集中学习策略的问题。离线RL能够广泛使用和复用历史数据集,同时缓解与在线探索相关的安全隐患,从而拓展RL在现实世界中的适用性。先前大多数离线RL工作聚焦于具有紧凑状态表示的任务。然而,能够直接从图像等丰富观测空间中学习对于机器人和现实应用至关重要。在本工作中,我们基于近期离线RL基于模型的算法进展,将其扩展至高维视觉观测空间。基于模型的离线RL算法在基于状态的任务上已取得最先进结果,并具备较强的理论保证。然而,它们关键依赖于量化模型预测中不确定性的能力,而这在图像观测下尤为困难。为克服该挑战,我们提出学习潜状态动力学模型,并在潜空间中表示不确定性。我们的方法在实践中易于处理,且对应于在未知POMDP中最大化ELBO的下界。在一系列具有挑战性的基于图像的 locomotion 与操作任务实验中,我们发现我们的算法显著优于先前的离线无模型RL方法以及最先进的在线视觉基于模型的RL方法。此外,我们还发现我们的方法在使用现有数据集的真实机器人基于图像的抽屉关闭任务上表现优异。所有结果(包括视频)可在线查阅:https://sites.google.com/view/lompo/ 。

关键词

引用

@article{arxiv.2012.11547,
  title  = {Offline Reinforcement Learning from Images with Latent Space Models},
  author = {Rafael Rafailov and Tianhe Yu and Aravind Rajeswaran and Chelsea Finn},
  journal= {arXiv preprint arXiv:2012.11547},
  year   = {2020}
}