中文

用于高效强化学习的行为先验

人工智能 2020-10-28 v1 机器学习

摘要

随着我们部署强化学习智能体以解决日益具挑战性的问题,能够将关于世界结构和有效求解策略的先验知识注入其中的方法变得愈发重要。本工作中,我们考虑如何将信息与架构约束同概率建模文献中的思想相结合,以学习行为先验,捕捉跨一组相关任务或情境所共享的常见运动与交互模式。例如,人类日常行为包含独特的运动与操作模式,这些模式在许多不同情境与目标中反复出现。我们讨论如何利用概率轨迹模型捕捉此类行为模式,以及它们如何有效集成到强化学习方案中,例如以促进多任务与迁移学习。我们随后将这些思想推广至潜变量模型,并考虑一种学习分层先验的公式,以可复用模块捕捉行为的不同方面。我们讨论此类潜变量公式如何与分层强化学习(HRL)及基于互信息和好奇心的目标等相关工作相联系,从而提供对已有思想的另一种视角。我们通过将框架应用于一系列模拟连续控制领域,展示了其有效性。

关键词

引用

@article{arxiv.2010.14274,
  title  = {Behavior Priors for Efficient Reinforcement Learning},
  author = {Dhruva Tirumala and Alexandre Galashov and Hyeonwoo Noh and Leonard Hasenclever and Razvan Pascanu and Jonathan Schwarz and Guillaume Desjardins and Wojciech Marian Czarnecki and Arun Ahuja and Yee Whye Teh and Nicolas Heess},
  journal= {arXiv preprint arXiv:2010.14274},
  year   = {2020}
}

备注

Submitted to Journal of Machine Learning Research (JMLR)