中文

在KL正则化强化学习中利用层级结构进行学习与迁移

机器学习 2020-01-24 v2 机器学习

摘要

随着强化学习智能体被赋予解决更具挑战性和多样化任务,将先验知识纳入学习系统并利用解空间中可复用结构的能力可能变得愈发重要。KL正则化期望奖励目标构成了实现此目的的一种可能工具。它引入了一个额外组件,即默认或先验行为,该行为可与策略一同学习,从而将强化学习问题部分转化为行为建模问题。本工作中,我们考虑当策略和默认行为均被潜变量增强时该框架的含义。我们讨论由此产生的层级结构如何用于实现不同的归纳偏置,以及其模块化如何有益于迁移。实证上,我们发现它们能在一系列连续控制任务上带来更快的学习与迁移。

关键词

引用

@article{arxiv.1903.07438,
  title  = {Exploiting Hierarchy for Learning and Transfer in KL-regularized RL},
  author = {Dhruva Tirumala and Hyeonwoo Noh and Alexandre Galashov and Leonard Hasenclever and Arun Ahuja and Greg Wayne and Razvan Pascanu and Yee Whye Teh and Nicolas Heess},
  journal= {arXiv preprint arXiv:1903.07438},
  year   = {2020}
}