中文

面向深度强化学习的塑性损失研究

机器学习 2024-11-04 v2 人工智能

摘要

深度神经网络的持续学习与固定数据集和凸型持续学习 regime 具有不同挑战。其中一种挑战是塑性损失,即在在线方式下训练的神经网络显示对拟合新任务能力下降。该问题在监督学习和离策略强化学习(RL)中受到广泛关注,已提出多种解决方案。然而,塑性损失在 on-policy 深度 RL 语境下受到的关注较少。本文对在 on-policy 深度 RL 中的塑性损失及多种缓解方法进行了广泛实验。我们证明在该语境下,域迁移下塑性损失普遍存在,许多在其他语境中解决该问题的方法无效,有时甚至比完全不干预还糟糕。在 contrast,我们发现一类“再生”方法能够在各种情境下稳健地缓解塑性损失,包括网格世界任务以及更具挑战性的环境如 Montezuma's Revenge 和 ProcGen。

关键词

引用

@article{arxiv.2405.19153,
  title  = {A Study of Plasticity Loss in On-Policy Deep Reinforcement Learning},
  author = {Arthur Juliani and Jordan T. Ash},
  journal= {arXiv preprint arXiv:2405.19153},
  year   = {2024}
}