基于多样性探索与对抗自校正的连续强化学习
机器学习
2019-06-24 v1 人工智能
机器人学
机器学习
摘要
深度强化学习在连续控制领域(如物理控制和自动驾驶)取得了显著进展。然而,由于灾难性遗忘,强化模型难以依次学习每个任务的策略。具体而言,模型在训练新任务时会遗忘过去学到的知识。我们从两个角度考虑这一挑战:i)由于任务信息与奖励关联不强,获取任务特定技能较为困难;ii)在连续控制领域中从以往经验学习知识较为困难。本文提出一种端到端框架,称为连续多样性对抗网络(CDAN)。我们首先开发一种无监督多样性探索方法,利用无监督目标学习任务特定技能。随后,提出一种对抗自校正机制,通过利用过往经验来学习知识。这两种学习过程 presumed 是互补的。为评估所提方法,我们提出一个新的连续强化学习环境,称为连续蚂蚁迷宫(CAM),以及一种称为归一化缩短距离(NSD)的新指标。实验结果证实了多样性探索与自校正的有效性。值得注意的是,我们的最终结果在NSD上优于基线18.35%,在平均奖励上优于0.61。
引用
@article{arxiv.1906.09205,
title = {Continual Reinforcement Learning with Diversity Exploration and Adversarial Self-Correction},
author = {Fengda Zhu and Xiaojun Chang and Runhao Zeng and Mingkui Tan},
journal= {arXiv preprint arXiv:1906.09205},
year = {2019}
}