中文

面向持续强化学习的策略巩固

机器学习 2019-06-18 v2 机器学习

摘要

我们提出一种应对深度强化学习中灾难性遗忘的方法,该方法对经验分布变化的时间尺度不可知,不需要任务边界的知识,并且能够在持续变化的环境中适应。在我们的策略巩固模型中,策略网络与一串隐藏网络交互,这些隐藏网络同时记住智能体在一系列时间尺度上的策略,并通过其自身历史正则化当前策略,从而提升其无需遗忘的学习能力。我们发现,在单任务、交替双任务以及多智能体竞争自博弈设定下,该模型在若干连续控制任务上的持续学习表现优于基线。

关键词

引用

@article{arxiv.1902.00255,
  title  = {Policy Consolidation for Continual Reinforcement Learning},
  author = {Christos Kaplanis and Murray Shanahan and Claudia Clopath},
  journal= {arXiv preprint arXiv:1902.00255},
  year   = {2019}
}

备注

Accepted at ICML 2019