中文

随机隐变量行动者-评论家:基于隐变量模型的深度强化学习

机器学习 2020-10-27 v4 人工智能 机器学习

摘要

深度强化学习(RL)算法可以利用高容量深度网络直接从图像观测中学习。然而,这些高维观测空间在实践中带来若干挑战,因为策略现在必须解决两个问题:表示学习与任务学习。在本工作中,我们分开处理这两个问题,通过显式学习能够加速从图像中进行强化学习的隐表示。我们提出随机隐变量行动者-评论家(SLAC)算法:一种样本高效且高性能的RL算法,用于直接从高维图像输入中学习复杂连续控制任务的策略。SLAC通过将随机序列模型与RL统一为单一方法,提供了一种新颖且原理性的途径——先学习紧凑的隐表示,再在该模型学习到的隐空间中进行RL。我们的实验评估表明,在一系列困难的基于图像的控制任务上,我们的方法在最终性能和样本效率方面均优于无模型与基于模型的替代方法。我们的代码和结果视频可在我们的网站上获取。

关键词

引用

@article{arxiv.1907.00953,
  title  = {Stochastic Latent Actor-Critic: Deep Reinforcement Learning with a Latent Variable Model},
  author = {Alex X. Lee and Anusha Nagabandi and Pieter Abbeel and Sergey Levine},
  journal= {arXiv preprint arXiv:1907.00953},
  year   = {2020}
}

备注

Project website: https://alexlee-gk.github.io/slac/