中文

从演示中学习高层表示

人工智能 2018-03-01 v3

摘要

分层学习(HL)是解决具有长时域与稀疏奖励的复杂序列决策问题的关键。它使学习智能体能够将大问题拆解为更小、更易管理的子任务。HL 的一种常见方法是为智能体提供若干解决整体问题小部分的高层技能。然而,一个主要的开放问题是如何确定一组合适的可复用技能。我们提出了一种原则性方法,利用人类演示基于演示动态的变化推断一组子目标。利用这些子目标,我们将学习问题分解为一个抽象的高层表示和一组低层子任务。抽象描述捕捉整体问题结构,而子任务捕捉所需技能。我们证明了可以联合优化这两个学习层次。我们表明所得方法在两个具有挑战性的问题——Atari 2600 游戏 Montezuma's Revenge 以及使 ant 机器人通过迷宫的模拟机器人问题——上显著优于先前的基线。

关键词

引用

@article{arxiv.1802.06604,
  title  = {Learning High-level Representations from Demonstrations},
  author = {Garrett Andersen and Peter Vrancx and Haitham Bou-Ammar},
  journal= {arXiv preprint arXiv:1802.06604},
  year   = {2018}
}