中文

持续深度强化学习中的可塑性丧失

机器学习 2023-03-15 v1 人工智能

摘要

在复杂且不断变化的世界中,持续学习的能力至关重要。在本文中,我们刻画了典型基于价值的深度强化学习(RL)方法在不同程度非平稳性下的行为。具体而言,我们证明了当深度 RL 智能体在一系列 Atari 2600 游戏间循环时,会丧失学习良好策略的能力。该现象在先前工作中以各种名义被提及——例如可塑性丧失、隐式欠参数化、首要偏差与容量损失。我们在大规模下对该现象进行了细致研究,并分析了在多个具有不同维度(如游戏间相似度、游戏数量、每游戏帧数)的实验中权重、梯度与激活随时间的变化,其中部分实验持续 50 天并包含 20 亿次环境交互。我们的分析表明,网络的激活足迹变得更稀疏,导致了梯度的衰减。我们研究了一种极为简单的缓解策略——拼接 ReLU(CReLU)激活函数——并证明了其在促进变化环境中持续学习的有效性。

关键词

引用

@article{arxiv.2303.07507,
  title  = {Loss of Plasticity in Continual Deep Reinforcement Learning},
  author = {Zaheer Abbas and Rosie Zhao and Joseph Modayil and Adam White and Marlos C. Machado},
  journal= {arXiv preprint arXiv:2303.07507},
  year   = {2023}
}