中文

作为分层强化学习内驱力的特征控制

机器学习 2020-01-14 v2 人工智能

摘要

稀疏奖励问题是当代强化学习中最困难的挑战之一。分层强化学习(HRL)通过使用一组时间扩展的动作或选项来解决这个问题,每个动作或选项都有其自己的子目标。这些子目标通常是为特定任务手工设计的。然而,在此我们引入了一类在视觉领域具有广泛适用性的通用子目标。我们方法的基础(与使用“辅助任务”的工作相同)是一个假设:控制环境各个方面的能力是一项本质上非常有用的技能。我们将此类子目标整合到一个端到端的分层强化学习系统中,并在 Atari 套件的多个游戏上测试了我们算法的两个变体。我们在其中最困难的游戏之一——Montezuma's Revenge——中突显了我们方法的优势,在该游戏中处理稀疏奖励的能力是关键。我们的智能体在该游戏中的学习速度比当前最先进的 HRL 智能体快数倍,并达到了相似的性能水平。更新 22/11/17:我们发现,带有简单整形奖励(即外在奖励 + 特征控制内驱力奖励)的标准 A3C 智能体在 Montezuma's Revenge 中的表现与我们的智能体相当。鉴于新进行的实验,我们 HRL 方法的优势更多归因于其从内驱力奖励中学习有用特征的能力,而非其利用分层组件探索和重用抽象技能的能力。这使我们对实验结果得出了新的结论。

关键词

引用

@article{arxiv.1705.06769,
  title  = {Feature Control as Intrinsic Motivation for Hierarchical Reinforcement Learning},
  author = {Nat Dilokthanakul and Christos Kaplanis and Nick Pawlowski and Murray Shanahan},
  journal= {arXiv preprint arXiv:1705.06769},
  year   = {2020}
}