通过减少 Churn 缓解持续强化学习中的可塑性损失
机器学习
2025-06-03 v1 人工智能
摘要
可塑性,即智能体适应新任务、环境或分布的能力,对持续学习至关重要。在本文中,我们从 churn(由小批量训练引起的对批外数据的网络输出变异性)的视角研究深度持续强化学习中的可塑性损失。我们证明:(1)可塑性损失伴随着由于 Neural Tangent Kernel (NTK) 矩阵秩逐渐下降而导致的 churn 加剧;(2)减少 churn 有助于防止秩塌缩,并自适应地调整常规 RL 梯度的步长。此外,我们引入了 Continual Churn Approximated Reduction (C-CHAIN),并证明它在 OpenAI Gym Control、ProcGen、DeepMind Control Suite 和 MinAtar 基准测试的多种持续学习环境中提高了学习性能并优于基线方法。
引用
@article{arxiv.2506.00592,
title = {Mitigating Plasticity Loss in Continual Reinforcement Learning by Reducing Churn},
author = {Hongyao Tang and Johan Obando-Ceron and Pablo Samuel Castro and Aaron Courville and Glen Berseth},
journal= {arXiv preprint arXiv:2506.00592},
year = {2025}
}
备注
Accepted to ICML 2025