面向持续强化学习的策略巩固
机器学习
2019-06-18 v2 机器学习
摘要
我们提出一种应对深度强化学习中灾难性遗忘的方法,该方法对经验分布变化的时间尺度不可知,不需要任务边界的知识,并且能够在持续变化的环境中适应。在我们的策略巩固模型中,策略网络与一串隐藏网络交互,这些隐藏网络同时记住智能体在一系列时间尺度上的策略,并通过其自身历史正则化当前策略,从而提升其无需遗忘的学习能力。我们发现,在单任务、交替双任务以及多智能体竞争自博弈设定下,该模型在若干连续控制任务上的持续学习表现优于基线。
引用
@article{arxiv.1902.00255,
title = {Policy Consolidation for Continual Reinforcement Learning},
author = {Christos Kaplanis and Murray Shanahan and Claudia Clopath},
journal= {arXiv preprint arXiv:1902.00255},
year = {2019}
}
备注
Accepted at ICML 2019