中文

提升基于图像的免模型强化学习的样本效率

机器学习 2020-07-10 v3 人工智能 机器人学 机器学习

摘要

训练智能体利用免模型强化学习(RL)直接从高维图像解决控制任务已被证明十分困难。一种有前景的方法是同时学习潜在表示与控制策略。然而,利用稀缺奖励信号拟合高容量编码器样本效率低且导致性能不佳。已有工作表明,辅助损失(如图像重建)可助力高效表示学习。但是,将重建损失纳入离策略学习算法常导致训练不稳定。我们探究其深层原因,并认定先前研究使用的变分自编码器是发散的成因。基于这些发现,我们提出改善训练稳定性的有效技术。由此得到一种简单方法,能够在 MuJoCo 控制任务上匹配最先进的免模型与基于模型的算法。此外,我们的方法对观测噪声表现出鲁棒性,在此设定下超越现有方法。代码、结果与视频匿名发布于 https://sites.google.com/view/sac-ae/home。

关键词

引用

@article{arxiv.1910.01741,
  title  = {Improving Sample Efficiency in Model-Free Reinforcement Learning from Images},
  author = {Denis Yarats and Amy Zhang and Ilya Kostrikov and Brandon Amos and Joelle Pineau and Rob Fergus},
  journal= {arXiv preprint arXiv:1910.01741},
  year   = {2020}
}