深度强化学习中稳定性与可塑性的神经元级平衡
人工智能
2025-04-14 v1 机器学习
摘要
与人类持续获取知识的能力不同,智能体在深度强化学习(DRL)中面临稳定性-可塑性困境,即在保留现有技能(稳定性)与学习新知识(可塑性)之间进行权衡。现有方法侧重于在网络层面平衡这两个方面,缺乏对单个神经元的充分区分和细粒度控制。为克服这一局限性,受特定神经元与任务相关技能密切相关的观察启发,我们提出了稳定性与可塑性的神经元级平衡(NBSP)方法。具体而言,NBSP 首先 (1) 通过一种目标导向的方法定义并识别对知识保留至关重要的强化学习技能神经元,然后 (2) 引入了一个框架,对这些神经元采用梯度掩码和经验回放技术,以在适应新任务的同时保留已编码的现有技能。在 Meta-World 和 Atari 基准上的大量实验结果表明,NBSP 在平衡稳定性与可塑性方面显著优于现有方法。
引用
@article{arxiv.2504.08000,
title = {Neuron-level Balance between Stability and Plasticity in Deep Reinforcement Learning},
author = {Jiahua Lan and Sen Zhang and Haixia Pan and Ruijun Liu and Li Shen and Dacheng Tao},
journal= {arXiv preprint arXiv:2504.08000},
year = {2025}
}
备注
Reinforcement learning, RL skill neuron, stability and plasticity