中文

激活函数优化方法:可学习级数线性单元(LSLU)

计算机视觉与模式识别 2024-09-16 v1 机器学习

摘要

有效的激活函数引入非线性变换,赋予神经网络更强的拟合能力,助其更好地适应真实数据分布。华为诺亚方舟实验室认为,相较于静态激活函数,动态激活函数更适合用于增强神经网络的非线性能力。清华大学的相关研究也建议使用动态调整的激活函数。基于清华大学与华为诺亚方舟实验室使用微调激活函数的思想,我们提出一种基于级数的可学习激活函数,称为LSLU(可学习级数线性单元)。该方法在提升准确率的同时简化了深度学习网络。该方法引入可学习参数 θ\thetaω\omega 来控制激活函数,使其适应当前层的训练阶段并提升模型的泛化能力。其原理是增加每个激活层的非线性,从而提升网络整体的非线性。我们在CIFAR10、CIFAR100及特定任务数据集(如Silkworm)上评估了LSLU的性能,验证了其有效性。分析了可学习参数 θ\thetaω\omega 的收敛行为及其对泛化的影响。我们的实验结果表明,LSLU在加速训练的同时,增强了原始模型在各种任务中的泛化能力。在VanillaNet训练中,参数 θ\theta 先减小,随后增大并趋于稳定,而 ω\omega 呈现相反趋势。最终,LSLU在CIFAR100上为VanillaNet实现了3.17%的准确率提升(表3)。代码可在 https://github.com/vontran2021/Learnable-series-linear-units-LSLU 获取。

关键词

引用

@article{arxiv.2409.08283,
  title  = {Activation function optimization method: Learnable series linear units (LSLUs)},
  author = {Chuan Feng and Xi Lin and Shiping Zhu and Hongkang Shi and Maojie Tang and Hua Huang},
  journal= {arXiv preprint arXiv:2409.08283},
  year   = {2024}
}