中文

用于分层深度强化学习的假设驱动技能发现

机器学习 2020-03-04 v3 人工智能 机器学习

摘要

深度强化学习(DRL)能够在从视频游戏到机器人操控的各种复杂高维任务上学习高性能策略。然而,标准 DRL 方法常受样本效率低下之苦,部分原因是它们旨在完全与问题无关。在本工作中,我们引入一种新颖的探索与分层技能学习方法,其样本效率源于它对物理世界及模拟物理的对象行为所做出的直观假设。具体而言,我们提出假设提出与评估(HyPE)算法,该算法从原始像素数据中发现对象,生成关于对象状态观测变化可控性的假设,并学习用于检验这些假设的技能层次。我们证明 HyPE 可在两个不同领域显著提升策略学习的样本效率:一个模拟机器人推块领域,以及一个流行基准任务:Breakout。在这些领域中,HyPE 比几种最先进的强化学习方法快一个数量级地学习到高分策略。

关键词

引用

@article{arxiv.1906.01408,
  title  = {Hypothesis-Driven Skill Discovery for Hierarchical Deep Reinforcement Learning},
  author = {Caleb Chuck and Supawit Chockchowwat and Scott Niekum},
  journal= {arXiv preprint arXiv:1906.01408},
  year   = {2020}
}

备注

Submitted to IROS 2020