中文

面向复杂观测的对比变分强化学习

机器学习 2020-11-10 v2 机器学习

摘要

深度强化学习(DRL)已在多种机器人任务中取得显著成功:操控、导航等。然而,自然环境中的复杂视觉观测仍是一大挑战。本文提出对比变分强化学习(CVRL),一种基于模型的方法,用于处理 DRL 中的复杂视觉观测。CVRL 通过对比学习,以判别方式最大化潜状态与观测之间的互信息,从而学习对比变分模型。它避免了像常用的生成式观测模型那样不必要地对复杂观测空间建模,并且显著更鲁棒。CVRL 在标准 Mujoco 任务上取得了与最先进基于模型的 DRL 方法相当的性能。在 Natural Mujoco 任务和具有复杂观测(如动态阴影)的机器人推箱任务上,它显著优于这些方法。CVRL 代码已公开于 https://github.com/Yusufma03/CVRL。

关键词

引用

@article{arxiv.2008.02430,
  title  = {Contrastive Variational Reinforcement Learning for Complex Observations},
  author = {Xiao Ma and Siwei Chen and David Hsu and Wee Sun Lee},
  journal= {arXiv preprint arXiv:2008.02430},
  year   = {2020}
}

备注

CoRL 2020 camera ready