中文

掌握视觉连续控制:改进的数据增强强化学习

人工智能 2021-07-21 v1 机器学习

摘要

我们提出 DrQ-v2,一种用于视觉连续控制的免模型强化学习(RL)算法。DrQ-v2 建立在 DrQ 之上,DrQ 是一种使用数据增强直接从像素学习的离策略 actor-critic 方法。我们引入了若干改进,从而在 DeepMind Control Suite 上取得最先进结果。值得注意的是,DrQ-v2 能够直接从像素观测解决复杂的人形运动任务,这是此前免模型 RL 未能实现的。DrQ-v2 概念简单、易于实现,并且与先前工作相比提供了显著更好的计算开销,大多数任务在单个 GPU 上仅需 8 小时训练。最后,我们公开发布 DrQ-v2 的实现,以为 RL 实践者提供一个强大且计算高效的基线。

关键词

引用

@article{arxiv.2107.09645,
  title  = {Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement Learning},
  author = {Denis Yarats and Rob Fergus and Alessandro Lazaric and Lerrel Pinto},
  journal= {arXiv preprint arXiv:2107.09645},
  year   = {2021}
}