中文

平衡表达性与鲁棒性:基于约束有理激活函数的强化学习

机器学习 2025-07-22 v1

摘要

可训练激活函数(其参数与网络权重一起优化)相对于固定激活函数具有更高的表达性。 Specifically, 以多项式比(有理函数)形式定义的可训练激活函数被提出用于增强强化学习中的塑性。然而,其对训练稳定性的影响尚不明确。本文在强化学习和持续学习场景中研究可训练有理激活函数。我们发现,虽然其灵活性增强了适应性,但也可能引入不稳定因素,导致RL中过度估计以及较长时间持续学习中的特征坍缩。我们的主要结果是展示了有理激活函数在表达性和塑性之间的权衡。为此,我们提出一种受约束变体,结构性地限制过度输出缩放,同时保持适应性。在MetaWorld和DeepMind Control Suite(DMC)环境中的实验表明,我们的方法提高了训练稳定性和性能。在包括带重新排列标签的MNIST和Split CIFAR-100的持续学习基准中,我们揭示了不同约束对表达性与长期保留之间平衡的影响。虽然在离散动作领域(如Atari)的初步实验未显示类似不稳定性,但这表明该权衡在连续控制领域尤为相关。总体而言,我们的发现为在动态非平稳环境中构建稳健且可适应的可训练激活函数提供了可操作的设计原则。代码地址:https://github.com/special1114/rl_rational_plasticity

关键词

引用

@article{arxiv.2507.14736,
  title  = {Balancing Expressivity and Robustness: Constrained Rational Activations for Reinforcement Learning},
  author = {Rafał Surdej and Michał Bortkiewicz and Alex Lewandowski and Mateusz Ostaszewski and Clare Lyle},
  journal= {arXiv preprint arXiv:2507.14736},
  year   = {2025}
}

备注

Accepted for oral presentation at CoLLAs 2025