伪重演:在无灾难性遗忘下实现深度强化学习
机器学习
2020-12-18 v6 人工智能
计算机视觉与模式识别
摘要
神经网络在多种应用中能取得优异结果。然而,当它们尝试顺序学习时,往往在学习新任务的同时灾难性地遗忘先前任务。我们提出一种模型,通过结合图像分类领域与强化学习领域中持续学习的思想,克服顺序强化学习中的灾难性遗忘。该模型具有双记忆系统,将持续学习与强化学习分离,并采用伪重演系统,通过深度生成网络“回忆”代表先前任务的条目。我们的模型顺序学习 Atari 2600 游戏而未表现出灾难性遗忘,并在全部三款游戏上持续保持高于人类水平的表现。这一结果是在以下条件下取得的:不随任务数量增加而要求额外存储、不存储原始数据、不重访过往任务。相比之下,以往最先进的解决方案在这些复杂深度强化学习任务上更易遗忘。
引用
@article{arxiv.1812.02464,
title = {Pseudo-Rehearsal: Achieving Deep Reinforcement Learning without Catastrophic Forgetting},
author = {Craig Atkinson and Brendan McCane and Lech Szymanski and Anthony Robins},
journal= {arXiv preprint arXiv:1812.02464},
year = {2020}
}