持续强化学习中的多任务学习与灾难性遗忘
机器学习
2019-09-24 v1 人工智能
机器学习
摘要
本文中,我们研究关于深度强化学习在多任务中使用的两个假设。第一个假设源于如下问题:在两项相似任务上训练的深度强化学习算法,能否通过更高效地学习一个三者均未遇到过的新相似任务,而胜过两个单独训练的单任务算法。第二个假设源于如下问题:同样在两项相似任务上训练并增强以弹性权重巩固(EWC)的同一多任务深度 RL 算法,能否在新任务上保持与无 EWC 的相似算法相当的性能,同时克服前两个任务中的灾难性遗忘。我们表明,在 Space Invaders 和 Demon Attack 上训练的多任务异步优势行动者-评论者(GA3C)算法,在评估新第三项任务即 Phoenix 时,实际上能够胜过分别为各单任务单独训练的两个单任务 GA3C 版本。我们还表明,当在第三项任务上训练两个已训练的多任务 GA3C 算法时,若其中一个增强以 EWC,其不仅能在新任务上取得相当性能,还能克服前两个任务中相当程度的灾难性遗忘。
引用
@article{arxiv.1909.10008,
title = {Multi-task Learning and Catastrophic Forgetting in Continual Reinforcement Learning},
author = {João Ribeiro and Francisco S. Melo and João Dias},
journal= {arXiv preprint arXiv:1909.10008},
year = {2019}
}
备注
11 pages