几何单项式 (GEM):一族有理 2N 可微激活函数
摘要
激活函数的选择在深度神经网络的优化和性能中发挥着关键作用。虽然整流线性单元(ReLU)因其简单性和有效性而保持主导地位,但其缺乏光滑性可能阻碍深度体系结构中的基于梯度的优化。在本工作中,我们提出了一族 光滑激活函数,其门控遵循对数逻辑累积分布函数,实现类 ReLU 性能,仅使用纯理性算术。我们引入了三个变体:GEM(基本家族)、E-GEM(一种 参数化的泛化,使其能够任意 近似 ReLU),以及 SE-GEM(一种分段变体,通过 junction 光滑性消除死神经元)。N 进行消融研究表明 对标准深度网络最为理想,将 GELU 在 CIFAR-10 + ResNet-56 上的缺口从 6.10% 降至 2.12%。光滑参数 进一步揭示了 CNN-Transformer 之间的权衡:对于深度 CNN, 为首选;而对于 Transformer, 为首选。在 MNIST 上,E-GEM 达到了最佳基线(99.23%)。在 CIFAR-10 + ResNet-56 上,SE-GEM () 超过了 GELU(92.51% vs 92.44%)——这是第一族 GEM 激活函数超过 GELU。在 CIFAR-100 + ResNet-56 上,E-GEM 将 GELU 缺口从 6.10%(GEM )降至仅 0.62%。在 GPT-2(124M)上,GEM 实现了最低的困惑度(72.57 vs 73.76 for GELU),其中 GEM 也超过了 GELU(73.32)。在 BERT-small 上,E-GEM () 实现了所有激活函数中最佳的验证损失(6.656)。 参数化揭示了尺度依赖的最优点:对于深度 CNN 和大型 Transformer,小 (--)为佳;而对于小型 Transformer(BERT-small),由于其深度受限且梯度不受约束,受益于大 ()。
引用
@article{arxiv.2604.21677,
title = {Geometric Monomial (GEM): a family of rational 2N-differentiable activation functions},
author = {Eylon E. Krause},
journal= {arXiv preprint arXiv:2604.21677},
year = {2026}
}
备注
26 pages, 4 figures, 16 tables