中文

Hadamard 表示:面向模型无关强化学习的性能支架

机器学习 2026-05-26 v5

摘要

深度强化学习代理在训练过程中会逐渐丧失表示能力:神经元变得静默,从网络中移除活跃容量,有效秩坍塌,留下的生存神经元冗余。现有的补救措施如定期重置或特殊神经网络架构大多是特定于算法或领域的。我们提出一种简单的架构修复方法,即 Hadamard 表示(HR),它将标准隐藏层替换为两个独立参数化层的元素级乘积。HR 通过两种互补机制发挥作用。首先,它减少了神经元变得静默的概率,这在以 tanh 为连续可微激活函数时尤其有价值:与静默的 ReLU 神经元(实际上被修剪)不同,饱和的 tanh 神经元会默默损坏下游层,将其输出权重固定为偏置。其次,独立于静默性,乘法结构捕获更丰富的特征交互,而不增加层宽,从而提高有效秩。我们在五个算法和三个领域上评估了 HR:在基于像素的离散动作 Atari 上使用 DQN、PPO 和 PQN,在 SimbaV2 上进行基于状态的连续控制,在 MR.Q 上进行视觉连续控制。HR 在不进行任何超参数调优的情况下,始终优于强基准,并且与参数匹配的更宽变体相比,排除了参数计数作为替代解释。

关键词

引用

@article{arxiv.2406.09079,
  title  = {Hadamard Representation: Scaffolding Performance Across Model-free RL},
  author = {Jacob E. Kooi and Zhao Yang and Mark Hoogendoorn and Vincent François-Lavet},
  journal= {arXiv preprint arXiv:2406.09079},
  year   = {2026}
}

备注

26 pages, 17 figures