中文

通过减少 Churn 缓解持续强化学习中的可塑性损失

机器学习 2025-06-03 v1 人工智能

摘要

可塑性,即智能体适应新任务、环境或分布的能力,对持续学习至关重要。在本文中,我们从 churn(由小批量训练引起的对批外数据的网络输出变异性)的视角研究深度持续强化学习中的可塑性损失。我们证明:(1)可塑性损失伴随着由于 Neural Tangent Kernel (NTK) 矩阵秩逐渐下降而导致的 churn 加剧;(2)减少 churn 有助于防止秩塌缩,并自适应地调整常规 RL 梯度的步长。此外,我们引入了 Continual Churn Approximated Reduction (C-CHAIN),并证明它在 OpenAI Gym Control、ProcGen、DeepMind Control Suite 和 MinAtar 基准测试的多种持续学习环境中提高了学习性能并优于基线方法。

关键词

引用

@article{arxiv.2506.00592,
  title  = {Mitigating Plasticity Loss in Continual Reinforcement Learning by Reducing Churn},
  author = {Hongyao Tang and Johan Obando-Ceron and Pablo Samuel Castro and Aaron Courville and Glen Berseth},
  journal= {arXiv preprint arXiv:2506.00592},
  year   = {2025}
}

备注

Accepted to ICML 2025