中文

测量梯度而非激活!增强深度强化学习中的神经元活动

机器学习 2026-02-03 v2

摘要

深度强化学习(RL)智能体经常遭受神经元活动丢失的困扰,这损害了它们适应新数据和持续学习的能力。量化和解决该问题的一种常用方法是 tau-dormant 神经元比例,它使用激活统计量来衡量神经元的表达能力。虽然这对简单的基于 MLP 的智能体有效,但该方法在更复杂的架构中失去了统计效力。为了解决这个问题,我们认为在先进的 RL 智能体中,维持神经元的学习能力(即通过梯度更新进行适应的能力)比保留其表达能力更为关键。基于这一洞察,我们将统计目标从激活转向梯度,并引入了 GraMa(Gradient Magnitude Neural Activity Metric,梯度幅度神经活动度量),这是一种用于量化神经元级学习能力的轻量级、架构无关的度量。我们表明,GraMa 能有效揭示跨多种架构的持续神经元不活跃现象,包括残差网络、扩散模型以及具有不同激活函数的智能体。此外,由 GraMa 指导的神经元重置在多个深度 RL 算法和基准测试(如 MuJoCo 和 DeepMind Control Suite)中持续提升了学习性能。

关键词

引用

@article{arxiv.2505.24061,
  title  = {Measure gradients, not activations! Enhancing neuronal activity in deep reinforcement learning},
  author = {Jiashun Liu and Zihao Wu and Johan Obando-Ceron and Pablo Samuel Castro and Aaron Courville and Ling Pan},
  journal= {arXiv preprint arXiv:2505.24061},
  year   = {2026}
}