中文

解耦累积量助力后继表示迁移至新任务

机器学习 2019-11-26 v1 机器学习

摘要

生物智能能够通过以数据高效的方式重用一项任务中的基础知识与技能来学习解决许多不同的任务。此外,许多此类技能是在无显式监督的内在驱动方式下获得的。这与最先进的强化学习智能体形成对比,后者通常从零开始学习每个新任务,并在知识迁移上举步维艰。在本文中,我们提出了一种原则性方法来学习一组基策略,当通过广义策略改进进行重组时,可保证最终任务空间的覆盖。特别地,我们专注于求解基于目标的下游任务,其中动作的执行顺序并不重要。我们从理论和经验上证明,学习少量在解耦潜空间中到达内在指定目标区域的策略,可被重用从而在对指数级更多的外在指定、通常显著更复杂的下游任务上快速达到高性能水平。我们的学习流程包括两个阶段。首先,智能体在完全无环境奖励的情况下学习内在生成的、基于目标的任务。其次,智能体利用此经验快速在众多不同的外在指定任务上达到高性能水平。

关键词

引用

@article{arxiv.1911.10866,
  title  = {Disentangled Cumulants Help Successor Representations Transfer to New Tasks},
  author = {Christopher Grimm and Irina Higgins and Andre Barreto and Denis Teplyashin and Markus Wulfmeier and Tim Hertweck and Raia Hadsell and Satinder Singh},
  journal= {arXiv preprint arXiv:1911.10866},
  year   = {2019}
}