深入探讨深度强化学习中的塑性机制
机器学习
2026-03-24 v1 人工智能
摘要
本文研究了深度强化学习(RL)中塑性损失的基本机制,这是一种关键挑战,使得神经网络失去适应非平稳环境的能力。虽然现有研究常依赖于如静默神经元或有效秩等描述性指标,但这些概述性指标无法解释潜在的优化动力学。我们提出了优化导向的塑性(OCP)假设,认为塑性损失源于先前任务的最优点对新任务成为差的局部最优解,导致参数在任务转换期间被困,从而阻碍后续学习。我们理论上建立了神经元 dormancy 与零梯度状态的等价性,表明梯度信号的缺失是dormancy的主要驱动因素。我们的实验表明,塑性损失在特定任务中高度依赖;值得注意的是,在切换到显著不同任务时,dormancy率高的网络可实现与随机初始化网络相当的性能,表明网络的容量仍然存在但被特定的优化景观所抑制。此外,我们的假设阐明了为何参数约束可缓解塑性损失——它们防止在局部最优解中深陷。经过在多种非平稳情景下的验证,我们的发现为理解和恢复复杂RL领域中网络塑性提供了严谨的优化基础框架。
关键词
引用
@article{arxiv.2603.21173,
title = {Rethinking Plasticity in Deep Reinforcement Learning},
author = {Zhiqiang He},
journal= {arXiv preprint arXiv:2603.21173},
year = {2026}
}